03 総合診療という領域/JAPANOTHER
総合診療の研究デザインは、本当に未確立なのか
前の記事で「検証として設計できる人が足りない」と書いた。だが調べると、日本専門医機構の整備基準は量的研究と質的研究の双方を到達目標に明記している。研究法そのものは存在する。足りないのは、その方法を信頼できる形で実装できる研究基盤の方だった。島根の数字を47都道府県8年分のデータで自分で組み直すと、単純な率比の分散の8割が介入前のわずか8件から来ていた。モデルは書ける。だがモデルを書けることと、識別に足るデータが存在することは別である。
ダイジェスト解説 VIDEO
前の記事の終わりに、私はこう書いた。プログラム評価を、記述ではなく検証として設計できる人が、この分野には足りない、と。
書いた直後から引っかかっていた。本当にそうなのか。「足りない」と言うためには、何が足りないのかを特定しなければならない。それを調べたのが、この記事である。
結論から言うと、私の書き方は不正確だった。ただし公開時の本文はここで「足りないのは設計の知識ではなかった」と書き、これも不正確だった※訂正。正しくは——研究デザインそのものが世界的に未確立なのではない。しかし日本には、その方法論を実際に使える研究者、時間、データ、研究ネットワークが足りていない。
この区別が、この記事の主題である。「デザインを知っている」ことと、「そのデザインが要求する情報量を供給できる研究基盤がある」ことは、別のことだ。
「デザインが未確立」という言い方は、何を指しているのか
まず、この分野について繰り返し語られる「研究デザインが不明瞭」「研究の方法論が確立していない」という言い方の出所を探した。
公開時の本文はここに「見つからなかった」「出典がない」と書いた。これは強すぎる※訂正。一般的な量的・質的研究法が存在しないという意味で方法論が未確立だ、と述べた資料は確かに見当たらない。だが後述するように、2014年の家庭医療学の総説は家庭医療固有の研究課題と、それに適した方法論体系をさらに確立する必要を明示的に論じている。「出典がない」と一刀両断にはできない。
日本専門医機構の総合診療専門研修プログラム整備基準——専門研修の内容を規定する制度文書——を全文検索すると、到達目標の「2.研究」にこう書かれている1。
1)日々の臨床の中から研究課題を見つけ出すという、総合診療や地域医療における研究の意義を理解し、症例報告や臨床研究を様々な形で実践できる。 2)量的研究、質的研究双方の方法と特徴について理解し、批判的に吟味でき、各種研究成果を自らの診療に活かすことができる。
制度は、研究デザインを確立済みの前提で書いている。方法論が未確立であるという記述は、この文書のどこにもない。
ただしこれは「専攻医に何を学ばせるか」という到達目標であって、日本の総合診療界に研究デザインの知識が行き渡っている証拠ではない※訂正。後述するRouyardらは、日本のプライマリ・ケア研究の第一の障壁として「too few GPs have formal research training」——正式な研究トレーニングを受けたGPが少なすぎる——を挙げている2。到達目標に書いてあることと、それが実装されていることは違う。
では、実際には何が起きているのか。一次資料で裏づけが取れたのは、まったく別の三つだった。
実際に起きていること①——量が、桁で違う
Rouyard らが、2015年以降に国際的な査読誌に発表された、プライマリ・ケア環境での無作為化比較試験を国別に数えている。人口1000万人あたりに標準化した値2。
Australia—23.2; United Kingdom—20.5; Canada—13.2; Germany—4.0; Japan—0.3
オーストラリアの77分の1である。ドイツと比べても13分の1。
ただしこの0.3は「日本で行われたRCTの総数」ではない※訂正。2015年以降・国際的な査読誌に掲載・著者らが定義するプライマリ・ケア環境という条件を満たす試験を、人口1000万人あたりに標準化した研究アウトプットの指標である。実数として著者らが日本で同定したのは4件である。公開時の本文は「これは質の話ではない。存在するかしないかの話だ」と書いたが、正確には——少なくともこの定義で見た研究アウトプット量に、約77倍の差がある、である。
そしてRouyardらは、この差の原因として障壁を名指ししている。第一に挙がるのが、先に引いた正式な研究トレーニングを受けたGPの少なさと、研究に割ける時間の不足である。
もう一つ、国内の数字がある。小松鉾と矢吹が、2010〜2012年の日本プライマリ・ケア連合学会学術大会の演題1,003件を追跡し、査読誌に掲載されたものを数えた3。
Of 1003 abstracts, 38 (3.8%, 95% CI 2.6% to 5.0%) were published in a peer-reviewed journal indexed in the MEDLINE database.
他国のプライマリ・ケア学会は40%を超える。そして著者らはこう書いている——「to our knowledge, the abstract publication rate observed in the present study was the lowest among all studies conducted in past decades, regardless of specialty」。診療科を問わず、過去数十年で最も低い。
なおこれは2010〜2012年の大会を対象とした数字である※訂正。2026年の現在形として使える値ではない。
ここで重要なのは、著者らが説明を四つ検討し、いずれも観察された低率を十分には説明しないと考察していることである。言語の壁か——整形外科学会では日本語でも差が出ないので「unlikely」。無作為化比較試験が少ないからか——非RCTでも他国は40%を超えるので「does not fully account」。抄録の質か——「also unlikely」。時間がないからか——複数演題を出すような活発な著者でも4.3%にとどまるので「a lack of time also seems unlikely to explain our findings」。(公開時の本文は「すべて否定している」と書いたが、原文はいずれも断定的な否定ではなく、十分な説明にならないという考察である。)
結論は、こうである。
other unknown predictive factors might strongly affect the abstract publication rate
原因は分かっていない。日本のプライマリ・ケア研究について最も引用される数字が、説明のつかない数字として置かれている。
実際に起きていること②——2014年、日本語の設計ガイダンスが乏しかった
「デザインが未確立」に最も近い実在の言明は、2014年の総説にあった。クラブトリーらが日本プライマリ・ケア連合学会誌に書いている4。
家庭医療学が日本で専門分野として認知されるためには、独自の研究課題やそれに適した研究法を確立することが必須である。しかし、家庭医療学研究をデザインするにあたってのガイダンスとなる日本語文献はほとんど存在しない。
主語をよく見たい。存在しないのはデザインではなく、日本語で書かれたガイダンス文献である。設計の方法は世界にある。それを日本語で読める形にした案内が薄い。
ただし公開時の本文は、ここを「まったく別の問題だ」と切り離しすぎていた※訂正。同じ引用の前半は「独自の研究課題やそれに適した研究法を確立することが必須である」と述べている。一般的な研究法が存在しないという意味ではないが、家庭医療固有の研究課題と、それに適した方法論体系をさらに発展させる必要は、この総説が明示的に論じていたことである。
そして、これは2014年時点の話である。2026年5月、学会はプライマリ・ケア研究の報告ガイドライン CRISP(Consensus Reporting Items for Studies in Primary Care)の日本語版を公開している。研究支援委員会を中心とした11名の翻訳チームによるものである5。「日本語の設計図がない」を現在形で書くことは、もうできない。
実際に起きていること③——規模が、小さい
三つ目が、いちばん具体的だった。学会の研究支援の規模である。
日本プライマリ・ケア連合学会の2026年度研究助成制度の募集要項を読むと、こうある6。個人研究は「助成件数 年間3件まで」「助成金額 1件当たり年間20万円」。チーム研究は「年間2件まで」「1件当たり年間20〜40万円」。
公開時の本文はここを「1年に配る研究助成の総額は、上限まで使っても200万円前後」と書いたが、数字を整理し直す※訂正。個人研究3件×20万円=60万円。チーム研究は1件あたり年20〜40万円を2年間なので、単年度に支出しうる上限は60+80=140万円、新規採択分に対する総コミット額の上限が60+160=220万円(うちチーム分は2年度に分割)である。
そしてこれは学会の研究関連予算の全体ではない。学会は研究助成のほかにPR3ネットワーク、研究人材育成、英文誌の支援など複数の研究支援制度を運営している。読み方としては——この学会が「個々の研究計画に直接配る助成枠」は、新規採択ベースで年220万円が上限である、が正確である。
人材育成の側も見た。2017年度に始まった「未来研究リーダー人材育成プロジェクト」は三コース制で、オンライン講義中心の研究基礎コースが定員10名、指導拠点について実際に研究を行う研究実践Aコースが定員1名、研究実践Bコースは募集停止中7。
ただし「年に1人」を、学会の研究人材育成全体の規模として読ませるのは正確でない※訂正。基礎コースは定員10名であり、Bコースにも過去の実績がある。言えるのは、指導拠点について長期の個別指導を受ける「研究実践Aコース」の募集規模が、定員1名ときわめて小さい、ということである。
そして、2013年から2019年にかけて「臨床研究デザイン道場」というワークショップが開かれていた。焦点はリサーチ・クエスチョンの構造化——研究設計のいちばん最初の一歩だ。現行の学会サイトに、このページは存在しない。
明るい材料もある。2025年、学会が全国規模の実践研究ネットワーク PR3 Network を正式プロジェクトとして立ち上げた。第一弾は心不全と多疾患併存のレジストリ研究で、2026年1月時点で60施設以上・150名以上が参加している8。
なお公開時の本文は「ようやく、である」と書いたが、これは日本初のPBRNではない※訂正。JADECOM-PBRN(地域医療振興協会、2018年6月設立)やCFMD-PBRNが先行している。PR3の新規性は、学会自身が主導する全国規模のPBRNであるという点にある。
島根の数字を、自分で組み直してみた
ここまでが状況の整理である。しかし「研究基盤が弱い」という話は、この連載で何度も書いてきた。今回やりたかったのは、それが具体的にどう効くのかを一つの例で見ることだった。
前の記事で扱った島根大学の論文を使う。日本専門医機構は都道府県別・領域別の専攻医採用数を毎年公表している。この9年分のPDFから、全47都道府県の数字を抜き出した9。論文が使ったのと同じ公開データである。
そして、都道府県と年の固定効果を入れたポアソン回帰で、差分の差分を推定した。島根の総合診療シェアが、センター設立(2021年)を境に、全国の趨勢が予測する水準からどれだけ離れたか。
点推定は大きい。島根の伸びは、全国トレンドが予測する水準の1.8倍である。だが信頼区間は1をまたぐ。介入開始年を2020年、2022年、2023年のどこに置いても同じだった。
ここで、公開時の本文がこの95%信頼区間を扱いすぎていた点を訂正する※訂正。介入が割り当てられた単位は都道府県であり、処置群のクラスタは島根県ただ一つである。差分の差分では通常、政策が割り当てられた単位のレベルで県内の系列相関を考慮するが、処置クラスタが1つしかない状況では、通常のクラスタ頑健推論そのものが壊れることが古くから知られており、Conley–Taber法やランダム化推論といった少数処置群専用の方法が別に研究されている。準ポアソンの分散比1.07が示すのは過分散が小さいことであって、県内の時系列相関を処理できていることではない。
したがってこの区間は、通常の準ポアソン回帰による参考値であり、差分の差分としての厳密な推論には適さない。この記事の論旨は、p値がつくかどうかにはない。
なぜ有意にならないのか
ここが、この記事でいちばん書きたかったところである。対数スケールの分散を分解した。
| 由来 | 分散への寄与 | 割合 |
|---|---|---|
| 島根の介入前(8件) | 0.1250 | 79.7% |
| 島根の介入後(34件) | 0.0294 | 18.7% |
| 他46県の介入前(577件) | 0.0017 | 1.1% |
| 他46県の介入後(1,297件) | 0.0008 | 0.5% |
この分解が何の分解なのかを、公開時の本文は書いていなかった※訂正。これは単純な4セルのポアソン率比を対数変換したときの分散近似(1/8+1/34+1/577+1/1297)における寄与であって、固定効果を入れた回帰全体の分散分解ではない。
正確に書けば——単純な差分の差分の率比をポアソン近似した場合、対数率比の標準誤差を構成する分散の約8割は、島根の介入前8件という小さいセルに由来する。
アウトカム側ではない。ベースライン側である。島根は介入後に34人を集めた。それは十分な数だ。しかし比較の相手である「介入前の島根」は、8人しかいない。8人から測った基準線の上には、どんな結論も立たない。
介入前が3年・8件しかない、ということ
では、なぜ介入前が8人しかいないのか。
島根の「介入前」とは2018〜2020年度である。そして2018年度は、総合診療専門医制度が日本で始まった最初の年だ。島根県の総合診療専攻医は、その年ゼロだった。
試しに介入開始を2019年に置いて計算しようとすると、割り算が成立しない。分母がゼロだからである。
公開時の本文は、ここから「新しい専門領域は、構造的に前後比較を使えない」と一般化した。これは行き過ぎである※訂正。
新しい領域でも前後比較はできる。今回問題なのは、この事例に固有の、短くて疎なベースラインである——制度開始が2018年、介入が2021年で介入前期間が3年しかなく、しかもそこにイベントが8件しかない。原理的に不可能なのではなく、この条件では因果推論がきわめて不安定になる、である。
「ゼロだから割り算できない」も同じである。それは率比という効果指標を選んだから起きる。率差なら0からでも計算できるし、ポアソンやベイズのモデルという選択肢もある。正確には——ゼロを含むと、乗法的な効果指標では推定が不安定になる。
並行トレンドについても補足しておく。介入前3年では並行トレンドの妥当性を十分に評価できない、という認識自体は正しい。ただし期間が長ければ並行トレンドを「証明」できるわけでもない※追記。事前トレンド検定には検出力の問題があり、検定を通過したことを条件に推論すると別の歪みが生じうることが指摘されている。事前トレンド検定だけで識別仮定を保証することはできない。
前の記事で私は、島根が15.8%という単年の値を8年加重平均の全国値と対置していることを指摘した。あれは処理の問題だった。今回見えたのはもっと深い層で、仮に完璧に処理しても、この設計では結論が出ない。
では、何を報告すればよかったのか
ここで、医学教育研究の側から出てきた枠組みが効いてくる。Cook・Bordage・Schmidt の三分類である10。
- Description——「What was done?」を問う。比較群を持たない。
- Justification——「Did it work?」を問う。比較はあるが、結果によって確認も反証もできる概念的枠組みを欠く。
- Clarification——「Why or how did it work?」を問う。結果によって確認または反証されうる概念的枠組みを持つことが特徴。
彼らの診断は、この記事の主題そのものである。
research in medical education still suffers from a more fundamental and apparently widespread problem, namely, the lack of a scientific approach. By this we are not implying the absence of scientific study designs and methods, for many studies employ rigorous designs. Rather, we have noted that many research studies fail to follow a line of inquiry that over time will advance the science in the field.
設計法がないのではない。探究の線が続いていないのだ。彼らは同時に「It would be a misuse of the classification if it were the sole criterion by which to grade existing research」とも明記していて、記述研究を否定しているわけではない。
島根の論文は自らを “A Descriptive Program Evaluation” と名乗っている。Description として正直である。要旨も最終的には「associated with」「promising approach」という慎重な語を選んでおり、限界の項では「this descriptive analysis cannot establish causal relationships」と明記している11。
したがって「記述研究なのに因果推論をした」と断じるのは、公開時の本文の書きすぎだった※訂正。考察の該当箇所は「the observed improvements cannot be readily attributed to enhanced financial incentives or major structural reforms but rather to the programmatic components of the generalist network」——観察された改善は財政的誘因や大きな構造改革にではなく、ネットワークの構成要素に帰属させうる——である。問うべきは断罪ではなく、記述的評価という設計に対して、考察での機序の解釈がどこまで許されるのかという線引きの方である。
そして、Description のままでも報告できたことがある。三つ挙げたい。
第一に、人時である。私が計算したところ、42名の総追跡は136.5人年、中央値2.8年、範囲0.8〜6.8年。40.5%(17名)が追跡2年以下で、5年以上は8名しかいない。88.1%という比率は、この分布を一つの数字に潰したものだ。Cochrane のハンドブックは、時間を伴うデータを二値として扱う条件をこう定めている12。
Time-to-event data can sometimes be analysed as dichotomous data. This requires the status of all patients in a study to be known at a fixed time point.
CDCの教材はさらに直截で、追跡が揃わないときに割合を使うと「The incidence proportion underestimates the true rate because it ignores persons lost to follow-up」と述べる13。
ここで公開時の本文は「離脱5名を人年で割れば3.7/100人年」と計算した。この計算は成立しない※撤回。人時の分母は、各人が実際に観察されリスク下にあった時間の合計でなければならない。ところが論文が公表しているのは「2026年1月時点で37/42名がネットワーク内に勤務」という一時点の状態であり、5名がいつ離脱したのかが分からない。2019年に加入して2020年に離れた人を2026年まで分母に算入することはできない。離脱日のない公開データから、正しい残留率は再構成できない。
そしてこれこそが、この節でいちばん言いたかったことである。本当に必要なのは人時だが、論文は各人の加入日と離脱日を提示していないため、読者の側では正しい残留発生率を組み立てられない。
では何を報告すればよかったのか。離脱日がなくても、加入コホートごとの1年・3年・5年の固定時点残留率なら計算できる。離脱日が取れるなら、Kaplan–Meier法による生存解析が最も自然である※追記。
第二に、検定である。論文はχ²=24.4という値を報告している。何を計算したものなのかが方法の記述からは判然としないので、再現を試みた。
つまりこれは二つの標本を比べた2×2表ではなく、文献から取った丸めた数値を帰無仮説に置いた1標本適合度検定だった。「88.1%は50%と違うか」という問いに、有意差がつく。
ただし公開時の本文は、これを検定手法の不適切さの話として書いていた。批判の焦点はそこではない※訂正。1標本適合度検定であること自体は、外部文献値との対比として不当ではない。問題は、帰無仮説に置かれた50%が、対照としての比較可能性を持っていないことである。追跡期間もキャリア段階も残留の定義も異なる別の研究の値であって、反実仮想ではない。
第三に、層別である。大学自身のプレスリリースには、42名のうち17名が地域枠等の出身であるという表が載っていた14。この一列を論文に入れて層別するだけで、言えることは増えていた。
二点、注意を補っておく※追記。第一に、論文本文にある17/42は「県外の医学部出身者」という別の変数である。たまたま同じ17という値になっているだけで、混同してはいけない。第二に、私自身がこの層別解析をできるわけではない。公開資料からは地域枠等出身の17名のうち何名が残留したかが分からないからである。書けるのは——著者らが個票レベルで地域枠等の出身を把握しているのなら、残留を地域枠別に提示するだけで、選択効果についての情報がかなり増える、というところまでである。
報告基準の側も、同じことを求めている。StaRI は事前に規定した主要アウトカムと目標値、期待される作用機序に対応づけた過程評価、文脈の変化を求める15。SQUIRE 2.0 の項目9は端的に「Approach used to establish whether the observed outcomes were due to the intervention(s)」——観察された結果が介入によるものだと確かめるために何をしたか——を要求する16。
そしてMRCの複雑介入の枠組みは、こうした状況での目標設定そのものを組み替える17。
The framework challenges the view that unbiased estimates of effectiveness are the cardinal goal of evaluation. It asserts that improving theories and understanding how interventions contribute to change … is an equally important goal.
効果量が出せないなら、洗練されたプログラム理論こそが成果である、と。島根には語るべき理論がある。孤立が障壁であり、関係性がそれを解くという理論だ。それを反証可能な形に書き、次の県が試せるようにすることは、88.1%を報告するより難しく、そして価値が高い。
継続性は、40年かけて測れるようになった
ここまで書くと、悲観的に聞こえるかもしれない。総合診療が扱うものは測りにくく、だから研究が積み上がらない、と。
その悲観自体には長い歴史がある。Howie は1996年に、生物医学が細胞と系の理論を持つのに対し、総合診療の中核である診察について「The aggregate of these skills and attitudes represents the values element of my model. It is the intellectually important part, and the part that is particularly resistant to quantification」と書いた18。知的に最も重要な部分が、最も定量化に抗う。
だが、その悲観を裏切った例がある。継続性である。
継続性は、まさに「測りにくい」概念の代表だった。Salisbury らは2009年になってもこう書いている19。
Researchers attempting to operationalise and measure continuity face a minefield of conceptual and practical problems.
実際、指標は乱立した。系統的レビューは44論文から32種類の継続性指標を同定している。それでも、この分野は諦めなかった。1977年に Bice と Boxerman が最初の定量指標を提案し、概念を「縦断的継続性」「関係性」「連携」に分割し、指標の性質を比べ、大規模データで検証を重ねた。
そして2018年、Pereira Gray らの系統的レビューが出る20。
18 (81.8%) high-quality studies reported statistically significant reductions in mortality, with increased continuity of care. 16 of these were with all-cause mortality.
継続性が高いほど、死亡率が低い。文化圏を越えて。1977年から数えて41年である。
ただし公開時の本文は、これを「41年かけて測れるようになった」と書いた。科学史としては作りすぎである※訂正。2018年のレビューは測定問題が解決した年ではない。同じレビュー自身が「We found such heterogeneity of continuity and mortality measurement methods and time frames that it was not possible to combine the results of studies」——測定方法と時間枠の異質性が大きく、研究結果を統合できなかった——と述べており、22件はすべて観察研究である20。
正確にはこうである。40年以上をかけて複数の操作的定義が開発され、大規模なアウトカム研究まで到達した。それでも測定法の標準化は未完成である。
それでもこの40年が示したことはある。「総合診療の対象は測れない」という命題ではなく、「測定困難」と「測定不能」は違うということだ。時間と人手をかければ、少なくともここまでは来られる。
救急は、定義がなければ作った
もう一つ、対比を置きたい。救急である。
小児救急研究ネットワーク PECARN の設立趣旨は、克服すべき障壁を四つ名指ししている21。
Among these recognized barriers are low incidence rates of serious pediatric emergency events, the need for large numbers of children from varied backgrounds to achieve broadly representative study samples, lack of an infrastructure to test the efficacy of pediatric emergency care, and the need for a mechanism to translate study results into clinical practice.
事象が少ない。代表性のある標本には多施設化が要る。検証の基盤がない。実践へ翻訳する仕組みがない。
公開時の本文は、これを「総合診療が抱えている問題と、ほぼ同じである」と書いた。重なる範囲を限定しておく※訂正。重大イベントの発生率の低さは、総合診療には一般には当てはまらない。総合診療が扱うのは、むしろ頻度の高い疾患、多疾患併存、継続性である。重なるのは残りの三つ——多施設化の必要、共通データと検証基盤の不在、実践への翻訳の仕組みの不在である。そしてこの三つの重なり方が、驚くほど正確である。
違うのは、救急がそれを2001年に文書化し、連邦資金で基盤を作ったことだ。
そして、私が最も好きな一文が、院外心停止の登録事業の設計文書にある22。
Where possible all definitions are referenced to existing literature. Where a common definition did not exist one was developed.
共通の定義が存在しない場合には、定義を作った。測れないから測らない、ではなく。
私にとっての意味
前の記事で書いた「検証として設計できる人が足りない」は、不正確だった。訂正したい。そしてこの記事が公開時に置いた「足りないのは設計の知識ではない」という言い方も、同じくらい不正確だった※訂正。
書き直すと、こうなる。研究法そのものは存在する。しかし「研究法を知っている」ことと、「その方法を信頼できる形で実装できる研究基盤がある」ことは、別である。日本では正式な研究トレーニングを受けたGPが少なく、研究に割ける時間、資金、多施設ネットワーク、標準化された縦断データが不足してきた。島根の例が示したのはその両方である——差分の差分というモデルは書ける。だが介入前3年・8件というデータ構造が、そのモデルの識別を成り立たせない。
つまり問題は「デザインの不在」ではなく、「デザインが要求する情報量を供給できる研究システムの不足」である。年220万円の助成枠と定員1名の実践コースでは、40年はもっと長くなる。
同時に、これは自分にとって悪い知らせではないと思っている。
継続性の40年が示すのは、この分野の測りにくさが時間と人数で解ける種類の問題だということだ。そして今、PR3 Network という全国基盤がようやく立ち上がった。60施設、150名。ここから先に必要なのは、天才ではなく、同じ問いを続ける人の数である。
Cook らの言葉を借りれば、この分野に足りないのは rigorous な設計ではなく、line of inquiry——時間をかけて一本につながる問いの線だ。線は、一人では引けない。
私が入ろうとしているのは、その線がまだ短い分野である。短いということは、自分が引いた分がそのまま伸びるということでもある。
訂正 CORRECTIONS
公開後に直したこと。本文は直したうえで、何をどう変えたかをここに残している。本文中の※ が、直した箇所を指す。
- 訂正「足りないのは設計の知識ではなかった」を撤回し、中心命題を組み替えた2026-09-01 · sekkeiこの主張は、記事自身が引用しているRouyardらの2025年論説と矛盾していた。同論説はプライマリ・ケア研究の第一の障壁として「too few GPs have formal research training, and those who do often struggle with overwhelming workloads, leaving little time for research」を挙げている。日本専門医機構の整備基準に量的研究・質的研究が明記されているのは「専攻医に何を学ばせるべきか」という到達目標であって、日本の総合診療界に研究デザインの知識が行き渡っている証拠ではない。中心命題を「研究法そのものは存在する。しかし研究法を知っていることと、その方法を信頼できる形で実装できる研究基盤があることは別である。問題はデザインの不在ではなく、デザインが要求する情報量を供給できる研究システムの不足である」に組み替えた。
- 訂正「新しい領域は、前後比較を使えない」という一般化を撤回した2026-09-01 · zengo新しい領域でも前後比較はできる。今回問題なのは、制度開始が2018年・介入が2021年で介入前期間が3年しかなく、そこにイベントが8件しかないという、この事例に固有の短く疎なベースラインである。原理的に不可能なのではなく、この条件では因果推論がきわめて不安定になる、が正確である。また「ゼロだから割り算できない」のは率比という効果指標を選んだために起きることで、率差なら計算でき、ポアソンやベイズのモデルという選択肢もある。節見出しを「新しい領域は、前後比較を使えない」から「介入前が3年・8件しかない、ということ」に改めた。
- 訂正差分の差分の95%信頼区間を因果推論の区間として扱っていた2026-09-01 · did-ci介入が割り当てられた単位は都道府県であり、処置群のクラスタは島根県ただ一つである。処置クラスタが1つしかない状況では通常のクラスタ頑健推論そのものが壊れることが知られており、Conley-Taber法やランダム化推論といった少数処置群専用の方法が別に研究されている。準ポアソンの分散比1.07が示すのは過分散が小さいことであって、県内の時系列相関を処理できていることではない。この区間は通常の準ポアソン回帰による参考値であり、差分の差分としての厳密な推論には適さない、と明記した。
- 訂正「不確実性のほぼ8割」が何の不確実性かを限定した2026-09-01 · bunsan79.7%という寄与は、単純な4セルのポアソン率比を対数変換したときの分散近似(1/8+1/34+1/577+1/1297)におけるものであって、固定効果を入れた回帰全体の分散分解ではない。「単純な差分の差分の率比をポアソン近似した場合、対数率比の標準誤差を構成する分散の約8割が島根の介入前8件という小さいセルに由来する」と書き直した。
- 追記事前トレンド検定の限界を補った2026-09-01 · pretrend介入前3年では並行トレンドを十分に評価できないという認識は正しいが、期間が長ければ並行トレンドを証明できるわけでもない。事前トレンド検定には検出力の問題があり、検定を通過したことを条件に推論すると別の歪みが生じうる。事前トレンド検定だけで識別仮定を保証することはできない旨を補った。
- 撤回残留率3.7/100人年という計算を撤回した2026-09-01 · jinnen人時の分母は各人が実際に観察されリスク下にあった時間の合計でなければならない。ところが論文が公表しているのは「2026年1月時点で37/42名がネットワーク内に勤務」という一時点の状態であり、5名がいつ離脱したのかが分からない。離脱日のない公開データから正しい残留発生率は再構成できない。計算を削除し、「本当に必要なのは人時だが、論文は各人の加入日と離脱日を提示していないため、読者の側では正しい残留発生率を組み立てられない」という指摘に置き換えた。
- 追記残留の報告方法として固定時点残留率と生存解析を挙げた2026-09-01 · retention離脱日がなくても、加入コホートごとの1年・3年・5年の固定時点残留率なら計算できる。離脱日が取れるならKaplan-Meier法による生存解析が最も自然である旨を補った。
- 訂正カイ二乗検定への批判の焦点を、手法から帰無仮説の比較可能性へ移した2026-09-01 · chi21標本適合度検定であること自体は、外部文献値との対比として不当ではない。問題は、帰無仮説に置かれた50%が、追跡期間もキャリア段階も残留の定義も異なる別の研究の値であり、反実仮想としての比較可能性を持っていないことである。
- 追記二つの「17」の混同と、自分では層別できないことを明記した2026-09-01 · sousasekiプレスリリースの17名は地域枠等の出身者、論文表1の17名は県外の医学部出身者であり、たまたま同じ値になっている別の変数である。また公開資料からは地域枠等出身の17名のうち何名が残留したかが分からないため、筆者自身がこの層別解析をできるわけではない。書けるのは、著者らが個票レベルで地域枠等の出身を把握しているのなら残留を地域枠別に提示するだけで選択効果についての情報が増える、というところまでである。
- 訂正「デザインが未確立という言い方には出典がない」を弱めた2026-09-01 · mikakuritsu一般的な量的・質的研究法が存在しないという意味で方法論が未確立だと述べた資料は見当たらない。しかし2014年の家庭医療学の総説は「家庭医療学が日本で専門分野として認知されるためには、独自の研究課題やそれに適した研究法を確立することが必須である」とも明記しており、家庭医療固有の研究課題と方法論体系をさらに発展させる必要は論じられていた。「出典がない」という一刀両断を撤回し、節見出しも「出典がない」から「何を指しているのか」に改めた。
- 訂正「日本語の設計図が、ない」を2014年時点の話に限定した2026-09-01 · nihongo2026年5月、日本プライマリ・ケア連合学会はプライマリ・ケア研究の報告ガイドラインCRISP(Consensus Reporting Items for Studies in Primary Care)の日本語版を公開している。研究支援委員会を中心とした翻訳チームによるものである。「日本語の設計図がない」を現在形で使うことはできない。節見出しも「2014年、日本語の設計ガイダンスが乏しかった」に改めた。
- 訂正RCT 0.3 が何の指標かを明記した2026-09-01 · rct030.3は日本で行われたRCTの総数ではなく、2015年以降・国際的な査読誌に掲載・著者らが定義するプライマリ・ケア環境という条件を満たす試験を人口1000万人あたりに標準化した研究アウトプットの指標である。実数として著者らが日本で同定したのは4件である。「これは質の話ではない。存在するかしないかの話だ」を「少なくともこの定義で見た研究アウトプット量に約77倍の差がある」に改めた。
- 訂正3.8%が2010〜2012年のデータであることを明記し、「四つすべて否定」を修正した2026-09-01 · abstract38この数字は2010〜2012年の日本プライマリ・ケア連合学会学術大会を対象としたものであり、2026年の現在形として使える値ではない。また著者らは四つの説明候補を「すべて否定した」のではなく、いずれも観察された低率を十分には説明しないと考察している。原文はRCTの少なさについて「does not fully account」である。
- 訂正学会研究助成の金額を整理し直し、研究予算全体と読ませない形にした2026-09-01 · josei個人研究3件×20万円=60万円、チーム研究は1件あたり年20〜40万円を2年間なので、単年度に支出しうる上限は140万円、新規採択分に対する総コミット額の上限が220万円(うちチーム分は2年度に分割)である。またこれは学会の研究関連予算の全体ではない。学会は研究助成のほかにPR3ネットワーク、研究人材育成、英文誌の支援など複数の研究支援制度を運営している。「個々の研究計画に直接配る助成枠は新規採択ベースで年220万円が上限」という書き方に改めた。
- 訂正「年に1人」を研究人材育成全体の規模として読ませない形に改めた2026-09-01 · acourse基礎コースは定員10名であり、Bコースにも過去の実績がある。言えるのは、指導拠点について長期の個別指導を受ける「研究実践Aコース」の募集規模が定員1名ときわめて小さい、ということである。
- 訂正PR3を「ようやく」と書いたのを、学会主導の全国PBRNという新規性に改めた2026-09-01 · pr3PR3は日本初のPBRNではない。JADECOM-PBRN(地域医療振興協会、2018年6月設立)やCFMD-PBRNが先行している。PR3の新規性は、学会自身が主導する全国規模のPBRNであるという点にある。
- 訂正「記述研究なのに因果推論をした」という断罪を、線引きの問いに改めた2026-09-01 · cook-inga島根の論文の要旨は「associated with」「promising approach」という慎重な語を選んでおり、限界の項には「this descriptive analysis cannot establish causal relationships」と明記されている。断罪ではなく、記述的評価という設計に対して考察での機序の解釈がどこまで許されるのか、という線引きの問いとして書き直した。
- 訂正「41年かけて測れるようになった」を、標準化が未完成である旨を含む形に改めた2026-09-01 · nen412018年のレビューは継続性の測定問題が解決した年ではない。同レビュー自身が「We found such heterogeneity of continuity and mortality measurement methods and time frames that it was not possible to combine the results of studies」と述べており、22件はすべて観察研究である。「40年以上をかけて複数の操作的定義が開発され、大規模なアウトカム研究まで到達した。それでも測定法の標準化は未完成である」と改め、この期間が示したのは「測定困難」と「測定不能」は違うということだ、と書き直した。
- 訂正救急との共通点を限定した2026-09-01 · pecarnPECARNが挙げた四つの障壁のうち、重大イベントの発生率の低さは総合診療には一般には当てはまらない。総合診療が扱うのはむしろ頻度の高い疾患、多疾患併存、継続性である。重なるのは残りの三つ——多施設化の必要、共通データと検証基盤の不在、実践への翻訳の仕組みの不在——である、と限定した。
出典 SOURCES
- 1総合診療専門研修プログラム整備基準一般社団法人 日本専門医機構 · accessed 2026-08-18裏付けた主張: 研修プログラムの認定基準を定める文書。到達目標の「2.研究」に二項目を置く。「1)日々の臨床の中から研究課題を見つけ出すという、総合診療や地域医療における研究の意義を理解し、症例報告や臨床研究を様々な形で実践できる。2)量的研究、質的研究双方の方法と特徴について理解し、批判的に吟味でき、各種研究成果を自らの診療に活かすことができる」。研究の文脈で方法論が未確立であるとする記述、あるいは研究デザインの不足を課題として挙げる記述は、文書中に存在しない
- 2Overcoming barriers to primary care research in Japan - a call to actionThe Lancet Regional Health - Western Pacific 56:101523 (Rouyard T ほか) · 2025 · accessed 2026-08-18裏付けた主張: 2015年以降に国際的な査読誌に発表された、プライマリ・ケア環境で実施された無作為化比較試験の数を国別に数えた論説。図1の説明に「Number of randomized controlled trials conducted in primary care settings published in international peer-reviewed journals on or after 2015」と定義を置く。人口1000万人あたりに標準化した値を「Australia—23.2; United Kingdom—20.5; Canada—13.2; Germany—4.0; Japan—0.3」と示す。日本のプライマリ・ケア研究が直面する障壁として、第一に「too few GPs have formal research training, and those who do often struggle with overwhelming workloads, leaving little time for research」を挙げる。著者らは自身が日本で無作為化比較試験を設計した経験に基づく一人称の報告であると位置づけている
- 3Full-text publication rate of abstracts presented at the Japan Primary Care Association Annual Meetings (2010-2012) - a retrospective observational studyBMJ Open 8(6):e021585 (Komagamine J, Yabuki T) · 2018 · accessed 2026-08-18裏付けた主張: 2010〜2012年の日本プライマリ・ケア連合学会学術大会の演題1,003件を追跡し、「Of 1003 abstracts, 38 (3.8%, 95% CI 2.6% to 5.0%) were published in a peer-reviewed journal indexed in the MEDLINE database」と報告する。国際比較として「Given that the publication rate of abstracts presented at annual scientific meetings for primary care in other countries is more than 40%, the publication rate of abstracts presented at JPCAMs is extremely low. Furthermore, to our knowledge, the abstract publication rate observed in the present study was the lowest among all studies conducted in past decades, regardless of specialty」と述べる。著者らは説明候補を四つ検討し、いずれも否定している。言語の壁は整形外科学会で差が出ないため「unlikely」、無作為化比較試験の少なさは非RCTでも他国が40%を超えるため「does not fully account」、抄録の質は「also unlikely」、時間不足は複数演題を提出した著者でも4.3%にとどまるため「a lack of time also seems unlikely to explain our findings」。結論として「other unknown predictive factors might strongly affect the abstract publication rate」と記す。口演7.3%対ポスター2.0%、大学所属6.4%対非大学2.4%、無作為化比較試験は1,003件中2件(0.2%)
- 4家庭医療学研究 - 新たな家庭医療学研究の展望日本プライマリ・ケア連合学会誌 37(2):116-123(クラブトリー BF、鳴本敬一郎、本原理子、フェターズ MD) · 2014 · accessed 2026-08-18裏付けた主張: 総説。冒頭に「家庭医療学が日本で専門分野として認知されるためには、独自の研究課題やそれに適した研究法を確立することが必須である。しかし、家庭医療学研究をデザインするにあたってのガイダンスとなる日本語文献はほとんど存在しない」と述べ、本文でも「日本において臨床研究が必要であるにも関わらず、家庭医療学研究をデザインし、実施する方略についてのガイダンスを提供する文献はほとんど存在しない」と繰り返す。指摘の対象は研究デザインそのものの不在ではなく、日本語で書かれた方法論ガイダンス文献の不足である
- 5CRISP Checklist日本語版公開のお知らせ一般社団法人 日本プライマリ・ケア連合学会 · 2026 · accessed 2026-08-31裏付けた主張: 2026年5月2日付の学会からの告知。CRISP(Consensus Reporting Items for Studies in Primary Care)を「プライマリ・ケア研究の報告の質を向上させることを目的とする、エビデンスに基づく取り組み」と説明し、William R. Phillips と Liz Sturgiss により開発されたものとする。日本語版は学会の研究支援委員会を中心とした翻訳チームが作成し、チームリーダーは杉山佳史(東京慈恵会医科大学)、チームメンバー9名(市川周平、小曽根早知子ほか)、スーパーバイザー2名(岡田唯男、水本潤希)の構成である。すなわち2026年時点では、プライマリ・ケア研究の報告ガイダンスの日本語版が学会から公開されている
- 62026年度 日本プライマリ・ケア連合学会 研究助成制度 募集要項一般社団法人 日本プライマリ・ケア連合学会 · 2026 · accessed 2026-08-18裏付けた主張: 学会の研究助成の規模を定めた文書。個人研究の助成は「助成件数 年間 3 件まで」「助成金額 1 件当たり年間 20 万円」。チーム研究の助成は「助成件数 年間 2 件まで」「助成金額 1 件当たり年間 20〜40 万円(総額 40〜80 万円)」で、研究助成期間は2年間。したがって学会が単年度に配分する研究助成の総額は、上限で見ても200万円前後にとどまる。成果要件として「原則として、研究終了後 2 年以内に原著論文として、Journal of General and Family Medicine などの英文誌に投稿する」ことを求め、進捗報告会への欠席や進捗の少ない研究には次年度の助成を行わないと定める。学会の制度説明ページは、この助成の目的を「まだ不足していると考えられる、わが国からのプライマリ・ケア分野の研究成果の発信を国際的に行えるように、英語論文化をゴールに設定しています」と記す
- 7未来研究リーダー人材育成プロジェクト一般社団法人 日本プライマリ・ケア連合学会 · accessed 2026-08-18裏付けた主張: 2017年度に開始された研究人材育成の枠組み。趣旨として「我が国におけるプライマリ・ケアの現場からの科学的なエビデンスの発信は少なく、その改善のためには、地域医療の現場を熟知し、かつリサーチマインドと高い研究能力を持つ人材の養成が必要不可欠であることはいうまでもありません」と述べる。三コース制で、研究基礎コースはオンライン講義中心(2022年度募集要項では臨床研究デザイン基礎編12コマ・応用編12コマ・解析デザイン演習7コマ、募集定員10名、受講料年間11万8千円のうち5万円を学会が補助)、研究実践Aコースは京都大学医学部附属病院臨床研究教育・研修部を指導拠点とし4年間で英文原著論文の投稿を要件とするが募集定員は1名、研究実践Bコースは募集停止中。なお2013年から2019年にかけて研究支援委員会の後援で開催されていた「臨床研究デザイン道場」(リサーチ・クエスチョンの構造化に焦点を置いたワークショップ)は、現行の学会サイトには該当ページが存在しない
- 8PR3 (PRimary care Real-world Registry) Network の立ち上げについて一般社団法人 日本プライマリ・ケア連合学会 · 2025 · accessed 2026-08-18裏付けた主張: 2025年4月11日付の学会ニュース。「この度本学会の正式なプロジェクトとして、学会員の全国的な研究ネットワーク(Practice Based Research Network: PBRN)を立ち上げ、プライマリ・ケア診療データベースの構築・活用を開始することになりました」と述べる。第一弾の研究テーマは心不全と多疾患併存で、クラウド型症例登録システムを用いた多機関レジストリ研究および前向きコホート研究として設計され、対象は診療所または200床未満の病院。代表者は青木拓也。2026年の続報では「2026年1月から第一弾の研究テーマである 心不全患者のレジストリ研究 を開始しています。すでに全国から 60施設以上の医療機関 、 150名以上の医師 に参画いただいています」と報告している。なお日本初のPBRNではなく、JADECOM-PBRN(地域医療振興協会、2018年6月設立)およびCFMD-PBRNが先行しており、PR3の新規性は学会主導の全国規模という点にある
- 9専攻医採用数 年次報告(2018〜2026年度)一般社団法人 日本専門医機構 · 2026 · accessed 2026-08-18裏付けた主張: 都道府県別・基本領域別の専攻医採用数を毎年度公表している一次資料。本稿の再解析はこの9年分のPDFから全47都道府県の総合診療採用数と県内全体の採用数を抽出して行った。島根県の総合診療/県内全体は2018年度 0/37、2019年度 3/44、2020年度 5/46、2021年度 7/61、2022年度 5/28、2023年度 5/40、2024年度 9/57、2025年度 8/57。2018〜2025年度を通算すると42/370で11.4%となり、島根大学の論文が対象とするN=42と採用数の合計が一致する。全国の総合診療/全体は2019年度 179/8,615、2020年度 222/9,082、2021年度 206/9,183、2022年度 250/9,448、2023年度 285/9,325、2024年度 290/9,454、2025年度 300/9,762。なお2024年度の報告書は都道府県名の一部にCJK部首補助の異体字を用いているため、機械的な抽出にはUnicode正規化を要する
- 10Description, justification and clarification - a framework for classifying the purposes of research in medical educationMedical Education 42(2):128-133 (Cook DA, Bordage G, Schmidt HG) · 2008 · accessed 2026-08-18裏付けた主張: 医学教育研究の目的を三分類する枠組み。Description は「Describes what was done or presents a new conceptual model. Asks 'What was done?' There is no comparison group」、Justification は「Makes comparison with another intervention with intent of showing that 1 intervention is better than (or as good as) another. Asks 'Did it work?'… Generally lacks a conceptual framework or model that can be confirmed or refuted based on results of the study」、Clarification は「Clarifies the processes that underlie observed effects. Asks 'Why or how did it work?'… Its hallmark is the presence of a conceptual framework that can be confirmed or refuted by the results of the study」と定義される。著者らの診断は「research in medical education still suffers from a more fundamental and apparently widespread problem, namely, the lack of a scientific approach. By this we are not implying the absence of scientific study designs and methods, for many studies employ rigorous designs. Rather, we have noted that many research studies in medical education fail to follow a line of inquiry that over time will advance the science in the field」というもので、「Rigorous study designs such as randomised trials can be used in such studies but, without prior model formulation and prediction, the results may have limited application to future research or practice」と続く。調査対象105件の内訳は justification 72%、description 16%、clarification 12%。ただし著者らは「It would be a misuse of the classification if it were the sole criterion by which to grade existing research」「We are not arguing for the disappearance of description or justification studies, but for a better balance among the 3 purposes」とも明記している
- 11A Decentralized, Academically Integrated Training Model for Rural General Practice in Japan - A Descriptive Program EvaluationJournal of General Internal Medicine (Sakaguchi K, Endo T, Shiraishi Y, Kaneko M, Watari T) · 2026 · accessed 2026-08-18裏付けた主張: 島根大学医学部附属病院総合診療医センターの研修モデルを記述した論文。方法の項に「Retention was defined as practicing within the Shimane prefectural network as of January 2026. For contextual comparison, the observed retention proportion was contrasted with the retention levels typically reported among physicians working in Japan's most rural clinical settings (approximately 50%), as described in a recent national epidemiological study, using a chi-squared test」と記す。結果は「As of January 2026, 37 of these residents (88.1%) were practicing at SGMC-affiliated medical institutions within the prefectural network. This proportion was substantially higher than retention rates typically reported in the literature for physicians working in similar rural settings (approximately 50%) (χ2 = 24.4, P < 0.001)」。本稿で確認したところ、42名を期待割合50%(期待度数21対21)と対比する適合度検定を行うと χ²=24.38 となり、報告値24.4と一致する。すなわち二標本の2×2表ではなく、文献由来の丸めた点推定値を帰無仮説とする1標本検定である。また対象は2018年から2025年に参加した42名だが、同論文は「Before the SGMC program was established in 2021」とも記しており、コホートの開始年が介入の開始年より3年早い。考察は「our project was implemented in a context in which these conditions remained largely unchanged. This observation is important because it suggests that the observed improvements cannot be readily attributed to enhanced financial incentives or major structural reforms but rather to the programmatic components of the generalist network」と述べる一方、限界の項では「this descriptive analysis cannot establish causal relationships」と明記しており、要旨も「associated with」「promising approach」という語を用いている。表1は出身大学を「Medical school location (local vs non-local)」として島根大学25名(59.5%)、その他17名(40.5%)に分けるものであり、地域枠に関する記述は本文・表・脚注のいずれにも存在しない
- 12Chapter 6 - Choosing effect measures and computing estimates of effectCochrane Handbook for Systematic Reviews of Interventions version 6.5 (Higgins JP, Li T, Deeks JJ 編) · 2024 · accessed 2026-08-18裏付けた主張: 時間を伴うデータを二値データとして扱ってよい条件を「Time-to-event data can sometimes be analysed as dichotomous data. This requires the status of all patients in a study to be known at a fixed time point」と定める。続けて「For example, if all patients have been followed for at least 12 months, and the proportion who have incurred the event before 12 months is known for both groups, then a 2×2 table can be constructed」と、全員が同じ最低追跡期間を満たしている場合を例示する。また件数データを二値データとして扱うことについて「A common error is to attempt to treat count data as dichotomous data」と述べ、この処理では「Any time element in the data is lost through this approach」と指摘する。追跡期間が揃わない場合の適切な扱いとして、人時を分母とする率、あるいは生存時間解析による方法を挙げ、「The most appropriate way of summarizing time-to-event data is to use methods of survival analysis」と記す
- 13Principles of Epidemiology in Public Health Practice, Third Edition - Lesson 3, Section 2 Morbidity Frequency MeasuresUS Department of Health and Human Services, Centers for Disease Control and Prevention · 2012 · accessed 2026-08-18裏付けた主張: 累積罹患割合と人時率の違いを説明した教材。人時率の分母について「The denominator is the sum of the time each person was observed, totaled for all persons. This denominator represents the total time the population was at risk of and being watched for disease」と定義し、その利点を「Because person-time is calculated for each subject, it can accommodate persons coming into and leaving the study」「the denominator accounts for study participants who are lost to follow-up or who die during the study period. In addition, it allows enrollees to enter the study at different times」と述べる。そのうえで、割合を用いた場合の帰結を「The incidence proportion underestimates the true rate because it ignores persons lost to follow-up, and assumes that they remained disease-free for all four years」と明示する
- 14総合診療専門研修プログラムの採用者数および地域枠出身者数(プレスリリース添付資料)島根大学医学部附属病院 · 2026 · accessed 2026-08-18裏付けた主張: 令和8年5月29日付のプレスリリース。添付資料1枚目が「総合診療専門研修プログラムの採用者数および地域枠出身者数」と題した年次表で、H31からR7までの採用者数とうち地域枠出身者数を示す。値は 0/0、3/0、5/3、7/3、5/2、5/4、9/3、8/2 であり、採用者数の合計42名は論文のN=42と一致し、地域枠出身者の合計は17名となる。注記は「地域枠等とは、島根大学(地域枠、緊急医師確保対策枠、県内定着枠、学士地域枠)、鳥取大学(島根県枠)および県奨学金貸与者を指す」。この17名は、論文表1の「その他(県外)の医学部出身17名(40.5%)」とは別の変数である。なお公開資料からは、地域枠等出身の17名のうち何名が残留したかは分からない
- 15Standards for Reporting Implementation Studies (StaRI) StatementBMJ 356:i6795 (Pinnock H ほか、StaRI Group) · 2017 · accessed 2026-08-18裏付けた主張: 実装研究の報告基準。27項目のチェックリストの土台を「Underpinning the 27 item StaRI Checklist is the concept of dual strands describing (a) the strategies used to promote implementation and (b) the intervention being implemented」と説明する。中心的な要求は「The expectation is that authors have an explicit hypothesis (we use the term 'logic pathway') that spans both how the implementation strategy is expected to work and the mechanism by which the intervention is expected to improve healthcare… This logic pathway should reflect the rationale presented in the introduction, determine the approach to implementation, dictate implementation, health, and process outcomes, and provide insights into why and how the implementation strategy and intervention worked (or not)」というもの。個別項目には、事前に規定した主要アウトカムと目標値(項目11)、期待される作用機序に対応づけた過程評価(項目12)、標本サイズの根拠(項目14)、実装対象集団の参加割合と特性(項目17)、文脈の変化(項目23)、意図しない有害な影響(項目24)などが含まれる
- 16SQUIRE 2.0 (Standards for QUality Improvement Reporting Excellence) - revised publication guidelines from a detailed consensus processBMJ Quality & Safety 25(12):986-992 (Ogrinc G, Davies L, Goodman D, Batalden P, Davidoff F, Stevens D) · 2016 · accessed 2026-08-18裏付けた主張: 医療の質改善活動を報告するための基準。項目9(Study of the intervention)は「Approach used to establish whether the observed outcomes were due to the intervention(s)」を求め、項目11(Analysis)は「Qualitative and quantitative methods used to draw inferences from the data. Methods for understanding variation within the data, including the effects of time as a variable」を、項目16(Limitations)は「Factors that might have limited internal validity such as confounding, bias or imprecision in the design, methods, measurement or analysis」を求める。実践と研究の区別について「'Doing' an improvement project is fundamentally different from 'studying' it. The primary purpose of 'doing' improvement is to produce better local processes and outcomes rather than contribute to new generalisable knowledge. In contrast, the reason for 'studying' the intervention is mainly to contribute to the body of knowledge about the efficacy and generalisability of efforts for improving healthcare」と述べる
- 17A new framework for developing and evaluating complex interventions - update of Medical Research Council guidanceBMJ 374:n2061 (Skivington K ほか、Medical Research Council / National Institute for Health Research) · 2021 · accessed 2026-08-18裏付けた主張: 複雑介入の開発と評価に関する英国MRCの指針を全面改訂した文書。要点として「A trade-off exists between precise unbiased answers to narrow questions and more uncertain answers to broader, more complex questions; researchers should answer the questions that are most useful to decision makers rather than those that can be answered with greater certainty」を掲げる。四つの研究視点(efficacy、effectiveness、theory based、systems)を提示し、theory based の問いを「What works in which circumstances and how?」、systems の視点を「Treats the intervention as a disruption to a complex system」と定義する。結論部で「The framework challenges the view that unbiased estimates of effectiveness are the cardinal goal of evaluation. It asserts that improving theories and understanding how interventions contribute to change, including how they interact with their context and wider dynamic systems, is an equally important goal」と述べる。またプログラム理論について「Programme theory describes how an intervention is expected to lead to its effects and under what conditions」「Where an intervention (such as a policy) is developed by others, researchers still need to theorise the intervention before attempting to evaluate it」と定め、理論に基づく視点をとる場合には「A refined programme theory is an important evaluation outcome and is the principal aim」であるとする
- 18Addressing the credibility gap in general practice research - better theory; more feeling; less strategyBritish Journal of General Practice 46(411):479-481 (Howie JGR) · 1996 · accessed 2026-08-18裏付けた主張: 総合診療研究の信頼性の低さを論じた論説。生物医学との対比を「The different specialisms which comprise bio-medicine draw for their knowledge base on complex theories which describe the behaviour of cells and systems in normal and abnormal functioning, but bio-medicine as a whole has never seen a need to reflect on the theory or models which describe how clinical decisions are taken in practice」と述べる。総合診療の中核を診察とし、その簡潔な理論として「content + values + context → outcomes」という図式を提示したうえで、「The aggregate of these skills and attitudes represents the values element of my model. It is the intellectually important part, and the part that is particularly resistant to quantification」と記す。そのうえで「much more emphasis in research needs to be given to 'values' and to 'context' than seems generally the case in much of the purely descriptive research into the processes of care which seems to predominate in our current general practice research and development culture」と述べる。同著者の1984年のBMJ論説は、当時の総合診療研究を「necessarily descriptive and epidemiological」と特徴づけている
- 19How should continuity of care in primary health care be assessed?British Journal of General Practice 59(561):e134-e141 (Salisbury C, Sampson F, Ridd M, Montgomery AA) · 2009 · accessed 2026-08-18裏付けた主張: 継続性という概念の測定方法を検討した研究。冒頭で「Researchers attempting to operationalise and measure continuity face a minefield of conceptual and practical problems」と述べ、「Although continuity of care is a core component in many international definitions of primary health care, the concept has been criticised as hard to define, and evidence about its benefits is equivocal」と現状を要約する。解決の方向として「it is important to distinguish between three distinct but related concepts, longitudinal continuity from a minimum number of health professionals, caring relationships between patients and professionals, and well-coordinated care between professionals」と概念の分割を提案する。指標の選択については continuity of care 指数を「an individual-based measure that takes account of the proportion of consultations with the same doctor, adjusted for the number of consultations」と説明し、その欠点を「the scores it provides do not have an intuitive meaning」と認めたうえで usual provider of care 指数も併算している。結論として「The approach that is taken should be based on a clearly articulated theory of how the intervention is intended to have an impact on continuity, and what is meant by continuity in the particular study」と述べる。なお継続性指標の乱立については Jee SH と Cabana MD の系統的レビュー(Medical Care Research and Review 2006;63(2):158-188)が44論文から32種類の指標を同定している
- 20Continuity of care with doctors—a matter of life and death? A systematic review of continuity of care and mortalityBMJ Open 8:e021161 (Pereira Gray DJ, Sidaway-Lee K, White E, Thorne A, Evans PH) · 2018 · accessed 2026-08-18裏付けた主張: 継続性と死亡率の関連を検討した系統的レビュー。「Of the 726 articles identified in searches, 22 fulfilled the eligibility criteria」とし、結果を「We found such heterogeneity of continuity and mortality measurement methods and time frames that it was not possible to combine the results of studies. However, 18 (81.8%) high-quality studies reported statistically significant reductions in mortality, with increased continuity of care. 16 of these were with all-cause mortality」と報告する。結論は「This first systematic review reveals that increased continuity of care by doctors is associated with lower mortality rates. Although all the evidence is observational, patients across cultural boundaries appear to benefit from continuity of care with both generalist and specialist doctors… Despite substantial, successive, technical advances in medicine, interpersonal factors remain important」。最も多く用いられた指標は usual provider of care 指数で、22件中10件(45.5%)であった。継続性の定量的指標の起点は Bice TW と Boxerman SB による1977年の Medical Care 誌の論文である
- 21The Pediatric Emergency Care Applied Research Network (PECARN) - rationale, development, and first stepsAcademic Emergency Medicine 10(6):661-668 (Pediatric Emergency Care Applied Research Network) · 2003 · accessed 2026-08-18裏付けた主張: 米国の小児救急研究ネットワークの設立趣旨を述べた論文。「There remain, however, many areas in emergency medical services for children (EMSC), in the out-of-hospital as well as the emergency department (ED) and hospital settings, that suffer from a lack of data to guide practice」という認識から出発し、「In an effort to expand the quality and quantity of research in pediatric emergency care, the Pediatric Emergency Care Applied Research Network (PECARN) was created in October 2001. PECARN is the first federally funded national network for research in EMSC」と設立を記す。克服すべき障壁を四点に明示する。「Among these recognized barriers are low incidence rates of serious pediatric emergency events, the need for large numbers of children from varied backgrounds to achieve broadly representative study samples, lack of an infrastructure to test the efficacy of pediatric emergency care, and the need for a mechanism to translate study results into clinical practice」。すなわち事象発生率の低さ、代表性のある標本を得るための多施設化、有効性を検証する基盤の不在、結果を実践へ翻訳する仕組みの不在である
- 22Rationale, development and implementation of the Resuscitation Outcomes Consortium Epistry—Cardiac ArrestResuscitation 78(2):161-169 (Morrison LJ, Nichol G, Rea TD ほか) · 2008 · accessed 2026-08-18裏付けた主張: 北米11地域を対象とする院外心停止の悉皆登録の設計文書。「The ROC Epistry—Cardiac Arrest is designed as a prospective population-based registry of all Emergency Medical Services (EMSs)-attended 9-1-1 calls for patients with out-of-hospital cardiac arrest occurring in the geographical area described by the eight US and three Canadian regions」と設計を述べ、データセットが北米の学際的運営委員会によって作られたことを記す。定義の扱いについて「Where possible all definitions are referenced to existing literature. Where a common definition did not exist one was developed」と明記しており、共通定義が存在しない場合には測定を諦めるのではなく定義そのものを作るという方針を採っている
関連記事 RELATED