YONAPO
← 記事一覧

測る道具の点検01 医療費と財源/JAPANEUROPEOTHER

その点検表は、何を見落としていたか

十本かけて指標を点検してきた。最後にその点検表そのものを点検する。第一に、七つの型のうち六つには既存の枠組みに近接する概念があったが、一対一には対応しない——反応性と「介入で動くこと」は別だし、生態学的誤謬は単位が違うこと一般ではない。第二に、採点の仕方が壊れていた。閾値を持たない指標は型3に落ちようがないので、「七つ全部を通った」は適用外の型が多いほど達成しやすい。点検すべきは指標そのものではなく、指標×用途×対象集団の組み合わせだった。この列の成果は新しい測定理論ではなく、合格・不合格・適用外・情報不足を分離する実務的な点検手順にある。

公開2026-08-25
更新2026-09-01
出典26 SOURCES

ダイジェスト解説 VIDEO

十本かけて、指標の来歴を辿ってきた。閾値がどこから来たのか。分母から誰が落ちるのか。制度が実際に読んでいるものは何か。比が何と何の比なのか。

最後に、その点検表そのものを点検する。

この列は、七つの「失敗の型」を使ってきた。定義/分母/閾値/交絡/反応性/単位/空白。十本のあいだ、この七つで指標を切ってきた。

では、この七つは何なのか。

結論から書く

三つある。

第一に、七つの型のうち六つには、既存の枠組みに近接する概念がある。うち三つは固有名詞化していた。ただし、意味が完全に重なるわけではない。

第二に、採点の仕方が壊れている。閾値を持たない指標は型3に落ちようがない。「七つ全部を通った」は、いくつかの型が適用外の指標なら、それだけで達成されてしまう。

第三に、概念として新しいものは、ほとんど無かった。残るのは型3の狭い一角である。

以下、順に。

六つには、近接する既存概念があった

ただし「同じもの」ではない。重なり方に幅があるので、そこも書いておく。

型近接する既存概念対応一次文献
1 定義content validity / clear standardisation部分的COSMIN1、NQF 2a12
2 分母the denominator problem / exclusions直接Bruckel ら 20173
3 閾値adequacy of the appraisal concept関連のみWHO/European Observatory4
4 交絡minimum bias / risk adjustment直接AHRQ5、NQF 2b42
5 反応性responsiveness部分的COSMIN1
6 単位ecological fallacy / unit of analysis関連のみRobinson 19506
7 空白(複数の概念に分かれる)対応せず—

表で「直接」としているのは型2と型4だけである。残りは部分的な対応か、関連にとどまる※訂正。見出しも「名前があった」から「近接する既存概念があった」に改めた。

ずれを四つ挙げておく。

content validity は、項目が測定対象の概念を十分に表現しているかを問う。私の型1は、同じ名前の下に別の構成概念が入っていることを問う。近いが、同じではない。

COSMIN の responsiveness は、主に患者報告アウトカム尺度が経時的な変化を検出できるかである。政策指標が介入で動くか(actionability)とは、対象も文脈も違う。

生態学的誤謬は、施設単位で集計すること自体を指すのではない。施設レベルの関連から個人レベルの関係を推論したときに、初めて誤謬になる。私の型6は「単位が変わること」を問うており、それは誤謬の前段にある。

型7は、無理に一語へ対応させないことにした※訂正。公開時は feasibility / content coverage を当てていたが、私が「空白」と呼んでいるものには、実行が困難で測れない/データが欠測している/構成概念そのものが欠けている/制度が測らないと決めているが混在している。既存概念が複数に分かれること自体が、この型の性格である。

型2は、論文の表題そのものだった3。

The denominator problem: national hospital quality measures for acute myocardial infarction

そして中身がこうである。

指標の除外は17.8%から90.1%まで幅があった。…除外されやすい患者は、より高齢で(78.1歳 対 50.3歳)、入院時の死亡リスクが高く、より高い院内死亡を経験していた(10.0% 対 1.6%)。

型5は、COSMIN の正式な測定特性名である1。

Responsiveness: The ability of an HR-PRO instrument to detect change over time in the construct to be measured

ただし公開時の本文は、これを「『介入しても動かない』は、この特性の裏返しにすぎない」と書いた。同一視している※訂正。

COSMIN の responsiveness は、測ろうとする構成概念が変化したとき、尺度がその変化を検出できるかである。介入がその構成概念を変えなかったこととは別である。介入が無効でも、尺度の反応性は高くありうる。

型5は、二つに分けるべきだった。

後者はCOSMINよりも、OECDやBarbazzaの指標枠組みに近い。

(型2の “the denominator problem” も、論文の表題ではあるが、それだけで標準化された固有名詞だと断定することはできない。)

型6には、75年前に名前がついていた6。

生態学的相関において、統計上の対象は人の集団である。…変数は百分率であり、集団の記述的属性であって、個人の記述的属性ではない。 …生態学的相関が個人の相関の代用として妥当に使えるかどうか。使えない。

そして医療については、Donabedian が1966年に書いている7。

最後に、アウトカムは集計としては良いケアと悪いケアを示しうるが、そのアウトカムが帰属されうる欠陥や強みの、性質と所在についての洞察を与えない。

実証も揃っている。施設の効果は、かかりつけ医の効果の少なくとも6倍6。医師の診療の違いで説明できるのは全分散の4%以下。これは単位の選び方が結果を左右することを示す分散分解であって、生態学的誤謬そのものの実証ではない。両者は近いが、別のことである。

七項目・問いの形という外形にも、類似例がある

外形の似た先行研究がある8。方法論的考慮事項が、ちょうど7項目で、各項目が問いの形をしている。

Clear standardisation. — Is the indicator clearly defined and replicable? Alignment of accountability. — Are entry points for taking action feasible? Sensitive to meaningful change. — Is the indicator sufficiently sensitive to change?

上から順に、私の型1・型6・型5に対応する。

ただし対応するのは3項目までで、残る4項目は私の型と一対一にならない。「七つ」「問いの形」という外形が似ていることは、設計全体が先行していたことの根拠にはならない。言えるのは、似た外形の先行例があるというところまでである。

そして「失敗の様式を番号付きで数える」という発想にも先行がある9。1995年に8つ——tunnel vision、sub-optimisation、myopia、measure fixation、misrepresentation、misinterpretation、gaming、ossification。

軸は違う。彼らが数えるのは使われ方の副作用で、私が数えるのは測定の妥当性の破綻である。だが「反転させた」という貢献も、そのままでは主張できない。

ただし、それらの枠組みも独立ではない

一つ、留保を置いておく。「複数の独立した枠組みが同じ基準に収束している」とは言えない。それぞれが出所を自分で書いている。

OECDの基準表は、末尾にこう記す4。

このリストは、米国医学研究所(2001年)の報告書『Envisioning the National Health Care Quality Report』から直接改変された。

AHRQも同様である5。

プロジェクトチームは、McGlynn らおよび Iezzoni らによる先行する評価と、電話面接から情報を集めて、質指標の性能の主要領域を特定した。

「新しくない」を強めるが、「独立に収束した」は弱める。

独自だと言えるのは、型3の一角だけだった

閾値の型にだけ、既存の枠組みに名前がない切り口がある。

最も近いのは WHO の統合基準の一項目である4。

Adequacy of the appraisal concept. Are reference values fit for purpose, and do they allow identification of good and bad providers?

ここは、慎重に線を引く必要がある。

型3の核——「線が分布から引かれているか、アウトカムから引かれているか」——は、独自ではない。それどころか、後で引く HbA1c 6.5% の文書が、まさにその区別を名指ししている10。旧基準は「合併症との関係ではなく、血糖値の分布に依拠していた」と。ガイドラインの定義文書が、自分で書いている。

残るのは、もっと狭い一角である。「他制度のカテゴリを流用している」「設問文が閾値を決めている」——この二つには、どの枠組みにも名前がない。

AHRQの6基準とOECDの3基準・9下位基準を全部読んでも、切断点の選び方や二値化について述べた項目は一つもない5,4。AHRQで最も近いのは「minimum bias」と「fosters real quality improvement」だが、どちらもそこには届かない。(これはこの二つの枠組みの中での不在であって、文献全体についての主張ではない。)

そして、この列が実際にやってきたのはそれだった。HbA1cの6.1%が空腹時血糖126から引き写されていたこと。認知症の重症度ランクを定めた1993年の通知が、導出について「作成したので」としか書いていないこと。日本の医療費の対GDP比が2011年に段差を持ったのが、国際専門家会合の投票(賛成23、反対8)の結果だったこと。

制度の側の来歴を辿ることは、測定特性の点検表には入っていない。

閾値については、報告指針が先に書いていた

ただし、型3の残りの部分も先行がある。臨床予測モデルの報告指針の解説文である11。

リスク群をどう作るか、そもそもいくつの群を使うかについて、明確な合意は存在しない。 こうした群分けは、恣意的でありながら、いかなる根拠も欠いたまま標準化されうる。 …しかし多くの場合、推定確率に基づくそうした明示的な指針は存在しない。

ただし公開時の本文は、これを「『多くの場合は分布由来』と、報告指針自身が書いている」とまとめた。引用を越えている※訂正。TRIPODが述べているのは、切点の作り方や、その切点に対応する臨床行動の根拠がしばしば明示されていないということである。「明示的な指針がない」ことは、「分布から決めた」ことを意味しない。

正確に書けばこうなる。多くの場合、切点と臨床行動を結ぶ根拠が明示されていない。

私が立てた命題も、一つ崩れた

この列は、こう記録していた——「型3と型2はトレードオフである。対象を絞ると閾値をアウトカムに固定できる。全員に当てはめると、線は分布からしか引けなくなる。」

反例がある。HbA1c 6.5% である10。

「あらゆる」網膜症の有病率が背景水準を超えて立ち上がり始める血糖値…そして糖尿病により特異的な「中等度」網膜症については、6.5%であった。 HbA1c値が6.5%未満であった2万人を超える対象者のうち、「中等度」網膜症はほぼ皆無であった。 同じデータのROC解析は、中等度以上の網膜症を検出する最適カットオフがHbA1c 6.5%であることを示した。

広く適用される診断閾値でありながら、分布ではなくアウトカムから引かれている。(同じ文書が適用外の集団も列挙している——妊娠、ヘモグロビン異常症、赤血球寿命の異常など。「普遍的」ではない。)

駆動因が違った。文献の定式化はこうである12。

分布基準の手法は、外部基準を必要としないため、使用が簡便であるという利点をもつ。

軸
私の命題対象を絞る → アウトカムに固定できる
文献の定式化アンカーが取れる → アンカー法/取れない → 分布法

「対象の広さ」は分布法を強制しない。

ただし、この二分法でも足りない。引いた文献は患者報告アウトカムの最小重要差についてのもので、診断閾値一般を二つに分ける枠組みではない。線の由来は少なくとも七つある——疾患や合併症などのアウトカム、治療による純利益、感度と特異度、分布、資源や収容能力、専門家の合意、そして他制度からの流用。

そしてアンカーがあることは、恣意性が無いことを意味しない。HbA1c 6.5% には網膜症というアンカーがあるが、「中等度」の網膜症を選ぶこと、そして誤分類をどこまで許すことにも、価値判断が残っている。

そして、同じ論文の中に両方の線が引かれた例がある。肺塞栓の Wells ルールである13。

最初の採点体系では…その割合は元の研究で決定されたものと同様になるようにした。 第二の体系は…後者の目標は、PE unlikely とされた患者でDダイマー陰性なら、PEが2%未満になることであった。

低・中・高の三分は分布から。likely / unlikely の二分はアウトカムから。同じ患者、同じ変数、同じ論文である。

採点の仕方が、壊れていた

閾値を持たない指標は、型3に落ちようがない。集計されない指標は、型6に落ちようがない。したがって「七つ全部を通った」は、いくつかの型が適用外の指標なら、それだけで達成されてしまう。

ただしこれは、点検表そのものの破綻ではない。採点の仕方の問題である。

直し方は二つある。

第一に、点検の対象を変える。同じ指標でも、連続値として経過を追うのか、二値化して診断に使うのか、施設の順位づけに使うのか、報酬の条件にするのかで、起きる問題が違う。点検すべきは指標そのものではなく、「指標 × 用途 × 対象集団」の組み合わせである。

第二に、結果を四つに分ける。

合格調べて、落ちなかった
不合格調べて、落ちた
適用外その型が当てはまらない
情報不足調べたが、判定できない

そして「適用可能な5項目中5項目」のように書く。そうすれば、適用外が自動的に合格に化けることを防げる。

この列は、それをやっていなかった。

唯一の合格例が、まさにそれだった

この列は、日本で七つ全部を通ったのは乳児死亡率だけと記録してきた。理由は、分子と分母が戸籍法の同じ台帳から来ていることだ、と。

三箇所直す。

① 同一の台帳ではなかった。人口動態調査令第3条である14。

市町村長は、戸籍法による届書又は昭和二十一年厚生省令第四十二号による届書その他の関係書類に基づいて…人口動態調査票を作成しなければならない。

原資は戸籍という台帳ではなく届書であり、出生票と死亡票は別々の調査票である。

ただしここも、書ける範囲を限定する※訂正。法令から確認できるのは、出生票と死亡票が別の調査票であることまでで、実務上まったく個票突合されていないことまでは導けない。また「同じ法律にもとづく二つの届出」も正確ではない——戸籍法上の届書と、人口動態調査令上の調査票が関係している。

正確に書けばこうなる。同じ人口動態統計制度の中で、別々に作成・集計された出生票と死亡票を用い、公表算式の上では個人単位のコホート突合を必要としない期間比である。

② 分母は「落ちている」のではなく、定義で切られている。

厚生労働省は集計客体を「日本において発生した日本人」と明記している15。令和6年の別掲は、在日外国人22,878、在外邦人10,725、前年以前発生1,103——計34,706件で、届出全体の4.81%にあたる。

当初、私はこれを「分母が4.81%落ちている」と書くつもりだった。それは誤りである。

在外邦人の出生は日本国内で発生していない。前年以前発生分はその年の事象ではない。どちらも場所または期間が定義と違うので、最初から対象外である。カバレッジの欠損ではない。

在日外国人は別の論点になる。「日本国内の全出生」を測るなら含めるべきで、「日本国内の日本人の出生」を測るなら正当な対象範囲である。どちらを測っているのかが、名前から読めないだけである。

したがって正確な言い方はこうなる——届出全体を基準にすると4.81%が本表の集計対象外だが、その大部分は地理・国籍・発生年の定義による除外であって、カバレッジ欠損率ではない。

それでも「誰を数えないか」という問いは立つ。ただし立て方が違う。定義上の対象外と、本来数えるべき対象の欠測は、分けなければならない。この列は10本かけて前者ばかり見ており、その区別を自分の合格例で外していた。

なお在日外国人だけを足し戻すと、乳児死亡率は1.845が1.846になる。分子(乳児死亡43)と分母(出生22,878)の両方を、同じ年・同じ発生地・同じ国籍区分で足したものである。在外邦人と前年以前発生分は、分子側の対応する数が公表されていないため足し戻せない。

③ 「定量した研究は見つかっていない」は誤りだった。日本語の論文が一本ある16。ただしこれは「真の補正値」ではなく、感度分析として読むべきものである。後期死産と早期新生児死亡の比を各国平均に揃えると——

補正前補正後
日本6.07.45
フィンランド6.56.64
スウェーデン6.46.73
米国11.911.86

日本の比は2.03で、米国の1.01やスウェーデンの1.24より突出して高い。

この方法は、登録実務の差だけでなく、医療水準・死産の発生率・積極的治療の方針・人工妊娠中絶の扱いまで各国で同じだと仮定している。1990年発表・1984年データ・被引用0でもある。6.0が7.45になることを「補正後の正しい値」として示すのは危険で、「ある仮定を置くと順位が動きうる」ことを示した一本、と読むのが妥当である。

現在の問題意識により近いのは、こちらである。日本を含む7か国の研究がある。22週の出生の生存率が3.7%から56.7%まで幅があり、その変動は「生産として報告される割合の違いから生じ、それ自体が積極的治療の提供と密接に結びついている」17※訂正。(公開時はこの記述に1990年のサンタマリア論文の脚注が付いていた。同じ出典項目に複数の論文を束ねていたためである。別の出典として分離した。)

逆向きの結論もある。出生体重分布を米国に揃えても日本の乳児死亡率は2.1から2.5にしかならず、日本の低さは主に医療の質による、という分析である。

国際機関は、既にそう扱っていた

OECDは、比較可能性への注記を置いている18。

乳児・新生児死亡率の国際的なばらつきの一部は、早産児の登録実務の各国間の違いによる可能性がある。

そして比較可能性を高めるため、「妊娠22週以上」に揃えた別系列も41か国から集めている。(「素の値は比較できないと判断した」とまでは、文書に書かれていない。)

WHOはさらに踏み込む。

乳児死亡率は、厳密に言えば率ではなく…生命表から導かれる死亡確率である。 …したがって、必ずしも各国の公式データと同じではない。 統計の主たる種類:調整済みかつ予測値。

両者は同じ概念——乳児の死亡——を測ろうとしている。違うのは推定の対象と算出の方法である。厚生労働省のものは未連結の年間出生数を分母とする期間比、WHOのものは国際比較のために調整・推計された死亡確率である※訂正。同じ概念を扱っているが、直接同一視はできない。

それでも、堅い部分は堅い

届出だけで完結するのは、乳児死亡率・新生児死亡率・早期新生児死亡率の3つだけである15。出生率も粗死亡率も合計特殊出生率も婚姻率も、分母に総務省の人口推計が入る。死産率と周産期死亡率は二つの法源にまたがる。妊産婦死亡率は分子がICDのO00–O99で定義され、死因分類に全面依存する。

同じ人口動態調査の中に、死因分類に依存する率と依存しない率が、両方ある。

そして回収率についての一文は、原文どおりだった。

人口動態調査は…市区町村が届出を受理した場合に調査票が作成されるため、回収率という概念は存在しない。

ただし、これは調査票を送って回収する方式ではない、という意味である。未届出・遅延届出・誤分類の可能性は、回収率ではなく登録の完全性(カバレッジ誤差)として別に評価すべきものになる。

「回収率100%に相当する」と「すべての出生が登録されている」は、別の命題である。そして後者を定量した公的資料には、到達できなかった。

落ちた指標が、何を教えるか

反例を探して、九つの候補を七つの型に当てた。旧採点法では、九つとも不合格とした※訂正。

ただしこれは、上で述べた「指標 × 用途 × 対象集団」を固定して再評価した結果ではない。旧採点法の結論をそのまま載せている。採点法を直したと書いた直後に、直す前の採点結果を使っている。再採点は、この記事ではできていない。

そのうえで、型3の姿がよく見えるものを挙げる。

Apgar——166名の専門職が同じ紙上症例を採点した結果、6が16%、7が55%、8が21%、9が7%19。同じ児が、採点者によって閾値7をまたぐ。そしてApgar自身の1953年の区分は0–2 / 3–7 / 8–10で、現行の0–3 / 4–6 / 7–10ではない。学会自身が「Apgarスコアだけでは、個々の新生児の死亡や神経学的転帰を予測しない」と書いている。ただし公平に言えば、Apgarは個人の長期予後を予測するために作られた指標ではない。想定外の用途で予測力が低いことは、指標そのものの失敗とは限らない。問題は、その用途に使われてきたことのほうにある。

出生体重2500g——1919年に提唱された際、「彼はこの特定の体重カットオフについて、いかなる正当化も示さなかった」20。翌年の論文は「我々は恣意的に2500g以下とした」と書いている。そして指標としては、低出生体重の割合が動かないまま、早産の割合が増え、SGAの割合が減った。

eGFR 60——二つの文書を並べておく21。2002年の K/DOQI が示す根拠は算術である(「成人の正常な腎機能の半分以上の喪失を表す」)。2010年の大規模プール解析は「死亡リスクはeGFR 75〜105の間では無関係で、それより低い値で増加した」(60でのハザード比は1.18、95%信頼区間1.05–1.32)とし、結論を「現行のKDOQI閾値と整合的」と書いた。

「データが60を特定した」とは書かれていない。——ただし「閾値が先に置かれ、データが後から来た」という筋書きは、どちらの文書も述べていない。発行年の並びからの、私の読みである。

そして2024年には、こう書かれている。

eGFRcr はJ字型の関連を示した…対照的に、eGFRcr-cys は分布全体を通じてはるかに線形の関連を示した。

測り方を変えると、曲線の形が変わる。——ただしこれは高い側(105超でリスクが上がって見えたこと)についての所見で、筋肉量などの影響だった可能性を示すものである。60という低い側の線が否定されたことを、直接には意味しない。そう読まないよう明記しておく。

CHA2DS2-VASc——2020年に Level A だった推奨が、2024年には Level C になった22。厳密には「同じ閾値の格下げ」とは言えない。2020年は CHA2DS2-VASc、2024年は性別項目を外した CHA2DS2-VA で、スコアの中身が違う。それでも、閾値を伴う推奨の格付けがこう動いたことは事実である。そのガイドライン自身の定義で、Level C は「専門家の意見の合意、および/または小規模研究、後ろ向き研究、レジストリ」である。そして——

年齢に関連するリスクは連続的であるが、実務上の理由から、75歳以上に2点が与えられる。

GCS——「一部の連続症例では、負傷患者の最大50%が、言語成分を欠くために解析から除外されなければならない」23。埋め方は二つ。定数を置くか(「挿管患者では、言語領域の評点は1と定義された」)、回帰で推定するか。そして——

導出されたGCSは、実際のGCSよりいくつかの指標で良好な成績を示した。

測らなかった項目を推定したほうが、観測したものより予測が良かった。

病院標準化死亡比——単位の型が数字で出る例である24。警報11件のうち少なくとも10件は誤報と推定されている。そして英国の病院で回避可能死亡の割合を実測した研究は、回避可能死亡は3.6%で、標準化死亡比との関連は「小さく、統計的に有意でない」(回帰係数0.3、95%信頼区間 −0.2〜0.7)とし、こう結論する。

死亡に基づくいかなる指標も、病院の質を反映しそうにない。

標本規模の問題もある。死亡率が2倍になったことを検出するのに必要な最小症例数は、人工股関節置換術で2,668件であり、それを満たす病院は1%未満である。

最も硬い二値ですら、分母に落ちる

この列を閉じるのに、一つの文がある。

「死んだか、死ななかったか」——医学で最も硬い二値である。観察者間のばらつきがない。それでも国際比較は歪む25。

500g未満の生産の割合は、ベルギーとアイルランドの1万出生あたり1未満から、カナダの10.8、米国の16.9まで、大きく幅があった。 極低出生体重・超早期在胎の出生の報告率の国際的な差は、おそらく出生登録の実務の違いを反映しており、周産期・乳児死亡率の国際順位の妥当性を損なう。

分母に「生産」として入るかどうかが、判断だからである。

そしてこれは、乳児死亡率を調べたときに出てきたのと同じ論文である。この列が最後の合格例として掲げようとしたものと、この列が想定しうる最も硬い試験とが、同じ一点に収束した。

この列にとって

まず、位置づけを直す。

七つの型は、新しい測定理論ではない。妥当性・分母・交絡・反応性・単位・実行可能性についての既存の概念を、日本の制度指標を使う側が、来歴まで遡って点検できるように組み直した実務的な点検表である。各型に既存の英語名がある以上、それを併記しないのは読者に対して不正確だった。

ただし「概念が既存だから独自性が無い」とは考えていない。新しさには層がある——概念そのものの新しさ/既存概念の統合/実務向けの操作化/日本の制度への適用。この点検表が主張できるのは後ろの三つで、最初の一つではない。そう書き直せばよかった。

第7回で、「道具が専門科を作った」という私の仮説は既存研究に否定された。今回問い直されたのは、その仮説を検証するのに使った道具のほうである。

そして、点検表が無駄だったとは思わない。

一つは、既存の基準がどれも英語で、指標を開発・承認する側に向けて書かれていること。NQFは指標を承認する委員会のための基準で、COSMINは尺度を評価する研究者のための分類である。目の前の数字が何でできているかを、使う側が辿るための道具としては書かれていない。

もう一つは、型3の一角である。「他制度のカテゴリを流用している」「設問文が閾値を決めている」——これは測定特性の話ではなく、制度の来歴の話である。既存の枠組みは、そこを見ない。そして日本の指標で実際に起きていたのは、ほとんどそれだった。

そして、何を測るかの合意について

この列が準備しようとしていたのは、何を測るかの合意だった。地域間で比較でき、全国に波及させられる計測項目を決めること。

十本を経て、その準備として言えることを書く。

① 名前を先に決める。同じ語が別のものを指す例を、この列は繰り返し見た。「医療費」が七通り。「レベル1」が最上位と最下位。Wellsの「代替診断」が肺塞栓版で+3、深部静脈血栓版で−2。合意は、測る前に名前で割れる。

② 誰を数えないかを、数える。Wells も Canadian C-Spine も、誰を外すかは書いているが、何人外れたかは書いていない26。除外基準は10項目あるのに、報告されているのは適格判定後の内訳だけである。研究の設計時に適格判定を記録しておけば、除外の規模の報告に追加の調査は要らない。(記録していない研究では、後から遡れない。)

③ 線を引くとき、何から引いたかを書く。HbA1c 6.5%の文書は、退けた方法を名指ししている10。「分布に依拠していた」「恣意的な決定がなされた」と。これができるなら、書かない理由はない。

④ 単位を混ぜない。個人について測ったものを施設の属性として使うこと自体は、誤りではない※訂正。問題になるのは、単位を越えて推論したときである。

個人から施設へ単位を移すとき、どの水準について推論するのかを明示する。施設レベルの関連を個人へ戻して解釈すれば、生態学的誤謬になる6。

施設の効果と医師の効果は6倍違う。

⑤ 適用外と情報不足を、合格から分ける。この列は「七つ全部を通った」と書いてきたが、通ったのか、当てはまらなかったのか、調べていないのかを区別していなかった。「適用可能な5項目中5項目」と書けば、それは防げる。

⑥ そして、自分の点検表も点検する。


最後に、この列の見取り図を書き直しておく。

七つの型は、まったく新しい測定理論ではない。妥当性・分母・交絡・反応性・単位・実行可能性についての既存の概念を、日本の制度指標を使う側が、その来歴まで遡って点検できるように組み直した実務的な点検表である。

今後は、指標そのものではなく「指標 × 用途 × 対象集団」の組み合わせを評価し、適用外と情報不足を合格から分離する必要がある。

そのうえで、この列に独自性があるとすれば、それは閾値の数値そのものではなく、その数値がどの制度・どの設問・どの分類から移植されてきたのかという、制度的な来歴を問う点にある。

この列の最初の記事は、地域を分母にすることについて書いた。分母を決めることは、誰を数えないかを決めることだった。

最後に分かったのは、その問いに使った道具のほうにも、同じ問いが立つということである。


この記事で最も確信度が低い箇所を明記しておく。

① 「七つの型を番号付きで列挙した先行分類は見つからなかった」は、検索範囲での不在である。不在の証明ではない。

② Smith 1995 の8項目は、原典に到達しておらず二次引用である。

③ 乳児死亡率の別掲の割合(4.81%)と足し戻した率(1.846)は、私の計算である。厚生労働省の公表値ではない。そして本文に書いたとおり、4.81%はカバレッジの欠損率ではない。足し戻したのは在日外国人のみで、在外邦人と前年以前発生分は分子側の対応する数が公表されていないため足し戻せない。

④ サンタマリア 1990 は、1990年発表・1984年データ・手法は比率標準化・被引用0である。「厳密な最新の定量」ではなく「存在を確かにする一本」として扱った。補正後の順位変動は論文には書かれていない。

⑤ Ottawa Ankle Rules の原著本文には到達できていない。本稿が引いたのは Canadian C-Spine Rule の側である。

⑥ Donabedian 1966 のページ範囲が、PubMed(166-206)と再録本文(166-203)で食い違う。また1988年 JAMA 論文の構造・過程・結果の定義文には到達できていない。

⑦ eGFRについて「閾値が先、データが後」という時系列の筋書きは、私の読みである。引いた文言は原本で確認したが、この順序関係を主張した文献に当たったわけではない。

⑧ 「独自だと言えるのは型3の一角だけ」は、私が調べた枠組み(NQF・PQM・COSMIN・AHRQ・OECD HCQI・WHO/European Observatory・AIRE・Barbazza・Schang)の範囲での判断である。そして本文に書いたとおり、型3の核(分布由来かアウトカム由来か)は既に名前がある。残ると考えているのは「他制度のカテゴリの流用」「設問文が閾値を決めている」という二つの角度だけで、これも「名前がない」の証明ではない。

訂正 CORRECTIONS

公開後に直したこと。本文は直したうえで、何をどう変えたかをここに残している。本文中の※ が、直した箇所を指す。

  1. 訂正反応性と「介入で動くこと」を同一視していた2026-09-01 · responsivenessCOSMINのresponsivenessは、測ろうとする構成概念が変化したときに尺度がその変化を検出できるかであり、介入がその構成概念を変えなかったこととは別である。介入が無効でも尺度の反応性は高くありうる。型5を「測定上の変化検出能力(responsiveness)」と「政策や介入によって改善しうるか(actionability / susceptibility to intervention)」の二つに分け、後者はCOSMINよりOECDやBarbazzaの指標枠組みに近い旨を明記した。
  2. 訂正「六つには名前があった」を対応の強さに合わせて改めた2026-09-01 · rokutsu表自身が「直接」としているのは型2と型4だけで、残りは部分的な対応か関連にとどまる。節見出しを「六つには、近接する既存概念があった」に改めた。また型2の "the denominator problem" も、論文の表題ではあるがそれだけで標準化された固有名詞だと断定することはできない旨を補った。
  3. 訂正型7に feasibility / content coverage を当てていたのをやめた2026-09-01 · kata7「空白」と呼んでいるものには、実行が困難で測れない/データが欠測している/構成概念そのものが欠けている/制度が測らないと決めている、が混在している。既存概念が複数に分かれること自体がこの型の性格であるとし、表の対応も「(複数の概念に分かれる)/対応せず」に改めた。
  4. 訂正TRIPODの記述から「多くの場合は分布由来」を導いていた2026-09-01 · tripodTRIPODが述べているのは、切点の作り方やその切点に対応する臨床行動の根拠がしばしば明示されていないということである。「明示的な指針がない」ことは「分布から決めた」ことを意味しない。「多くの場合、切点と臨床行動を結ぶ根拠が明示されていない」に改めた。
  5. 訂正採点法を直した直後に、直す前の採点結果をそのまま使っていた2026-09-01 · kyuutsu「指標×用途×対象集団」で点検すべきだと書いた直後に、旧採点法による「九つとも落ちた」という結論を提示していた。「旧採点法では九つとも不合格とした。ただしこれは、用途・対象集団を固定して再評価した結果ではない」と明記した。再採点はこの記事ではできていない。
  6. 訂正乳児死亡率について「突合されていない」「同じ法律にもとづく二つの届出」を訂正した2026-09-01 · nyuji法令から確認できるのは出生票と死亡票が別の調査票であることまでで、実務上まったく個票突合されていないことまでは導けない。また関係しているのは戸籍法上の届書と人口動態調査令上の調査票であり、「同じ法律にもとづく二つの届出」も正確ではない。「同じ人口動態統計制度の中で、別々に作成・集計された出生票と死亡票を用い、公表算式の上では個人単位のコホート突合を必要としない期間比である」に改めた。あわせて「粗い期間率」も「未連結の年間出生数を分母とする期間比」に改めた。
  7. 訂正「個人について測ったものを施設の属性として使うのは1950年に名前のついた誤り」を訂正した2026-09-01 · tani個人データを施設単位に集計すること自体は誤りではない。単位を越えて推論したときに問題になる。本文の前半では正しく説明していたのに、提案の節で再び広く言い切っていた。「個人から施設へ単位を移すとき、どの水準について推論するのかを明示する。施設レベルの関連を個人へ戻して解釈すれば、生態学的誤謬になる」に改めた。
  8. 訂正7か国の22週出生研究に1990年のサンタマリア論文の脚注が付いていた2026-09-01 · shutten同じ出典項目に複数の論文を束ねていたためである。Smith 2018 を別の出典として分離した。あわせて、OECDの出典claimにあった「素の乳児死亡率が比較できないとOECD自身が判断している」という記述も、本文で既に訂正していたとおり文書にそこまで書かれていないため、メタデータ側も修正した。

出典 SOURCES

  1. 1The COSMIN study reached international consensus on taxonomy, terminology, and definitions of measurement properties for health-related patient-reported outcomesMokkink LB, Terwee CB, Patrick DL, Alonso J, Stratford PW, Knol DL, Bouter LM, de Vet HCW. Journal of Clinical Epidemiology. 2010;63(7):737-745 ※定義の逐語は COSMIN checklist manual (January 2012) Table 1 から取得した · 2010 · accessed 2026-08-25裏付けた主張: 患者報告アウトカム尺度の測定特性を国際的な合意で分類した体系。3ドメイン(Reliability, Validity, Responsiveness)と7つの測定特性からなる。本稿の型5に対応するのは Responsiveness で、定義は「The ability of an HR-PRO instrument to detect change over time in the construct to be measured」である。すなわち「介入しても動かない」は、この体系の正式な特性名の裏返しである。型1に対応するのは Content validity で「The degree to which the content of an HR-PRO instrument is an adequate reflection of the construct to be measured」。なお Interpretability は「not considered a measurement property, but an important characteristic」として別立てされる。現行の COSMIN Risk of Bias checklist V3 は開発1+測定特性9の10ボックス構成である。本稿がマニュアル全文を検索したところ feasibility の語は0件で、この体系には含まれていない
  2. 2Measure Evaluation Criteria and Guidance Summary Tables(Effective for Projects Beginning after January 2011)National Quality Forum ※qualityforum.org は自動取得を遮断するため Internet Archive の保存版から取得した · 2011 · accessed 2026-08-25裏付けた主張: 米国で長く用いられた質指標の評価基準。「Measures considered as potential voluntary consensus standards are evaluated by a multistakeholder steering committee against four major criteria (Importance to Measure and Report, Scientific Acceptability of Measure Properties, Usability, and Feasibility)」とし、4つの主要基準の下に20の番号付き下位基準を置く。本稿の型に直接対応するものが複数ある——2a1「The measure is well defined and precisely specified so it can be implemented consistently within and across organizations and allow for comparability」(型1)、2b1「The measure is specified to capture the most inclusive target population indicated by the evidence, and exclusions are supported by the evidence」および 2b3「Exclusions are supported by the clinical evidence; otherwise, they are supported by evidence of sufficient frequency of occurrence so that results are distorted without the exclusion」(型2)、2b4「an evidence-based risk-adjustment strategy … is based on factors that influence the measured outcome (but not factors related to disparities in care or the quality of care)」(型4)。脚注は「Risk models should not obscure disparities in care for populations by including factors that are associated with differences/inequalities in care … It is preferable to stratify measures by race and socioeconomic status rather than to adjust out the differences」とし、交絡調整が格差を隠す危険を明示する。なお米国の合意形成主体は2023年3月に Battelle へ移り、現在は Partnership for Quality Measurement が5領域(Importance, Equity, Feasibility, Scientific Acceptability, Use and Usability)で評価している
  3. 3The denominator problem: national hospital quality measures for acute myocardial infarctionBruckel J, Liu X, Hohmann SF, Karson AS, Mort EA, Yeh RW. BMJ Quality & Safety. 2017;26(3):189-199 · 2017 · accessed 2026-08-25裏付けた主張: 急性心筋梗塞の病院質指標について、除外の規模と偏りを実測した研究。表題そのものが「the denominator problem」である。抄録は「Measure exclusions ranged from 17.8% … to 90.1% … Patients most likely to be excluded … were older (78.1 vs 50.3 years), … higher admission mortality risk … experienced higher inpatient mortality (10.0% vs 1.6%)」とする。すなわち除外された患者のほうが高齢で、入院時のリスクが高く、院内死亡が6倍以上高い。本稿は抄録を確認したが本文には到達していない。関連して AHRQ の Quality Indicators は分母からの除外理由を6つ列挙している(Empirical Methods 2024 §F.3.2)——アウトカムが入院時既存として符号化されている/予防が非常に困難/有害事象のリスクが非常に低い/臨床家にとっての表面的妥当性を高める/他施設へ転院した/指標の構成に必要なデータ項目が欠けている
  4. 4Health Care Quality Indicators Project: Conceptual Framework Paper(OECD Health Working Paper No. 23)Kelley E, Hurst J. OECD Publishing, Paris · 2006 · accessed 2026-08-25裏付けた主張: OECD の質指標の選定基準。「the criteria for the selection of a set of key indicators should include: − the importance of what is being measured in terms of the impact on health status and health costs, the policy relevance and the susceptibility of the problem to intervention; − the scientific soundness of the measure in terms of its validity, reliability, and the explicitness of the evidence base; − the feasibility and cost of obtaining internationally comparable data for the measure」。3基準・各3下位で計9。文書自身が出所を明記している——「This list has been modified directly from the report 'Envisioning the National Health Care Quality Report' by the US Institute of Medicine (2001)」。なお同じプロジェクトの Working Paper No. 22(DOI 10.1787/481685177056)は下位区分が一致しない。関連して WHO/European Observatory の Box 3.1「Criteria for indicators」は4次元16基準を統合しており、本稿の型3に最も近い基準として「Adequacy of the appraisal concept. Are reference values fit for purpose, and do they allow identification of good and bad providers?」を置く
  5. 5Refinement of the HCUP Quality Indicators, Technical Review No. 4(AHRQ Pub. 01-0035)Agency for Healthcare Research and Quality, 2001 · 2001 · accessed 2026-08-25裏付けた主張: 質指標の6つの評価基準を定める——「1) Face validity. An adequate quality indicator must have sound clinical and/or empirical rationale for its use. 2) Precision. An adequate quality indicator should have relatively large variation among providers that is not due to random variation or patient characteristics. 3) Minimum bias. The indicator should not be affected by systematic differences in patient case-mix, including disease severity and comorbidity. 4) Construct validity. 5) Fosters real quality improvement. The indicator should be robust to possible provider manipulation of the system. 6) Application」。本稿の型4に対応するのは Minimum bias である。また交絡調整そのものが逆向きに働きうることも書かれている——「most administrative data sources do not distinguish disorders that can be in-hospital complications from pre-existing comorbidities. To the extent that diagnoses such as shock and pulmonary edema may result from poor quality of care, their incorporation in prediction models may bias estimates of expected mortality, and even favor hospitals whose care results in more complications」。なお同報告の構造化抄録および続編(Technical Review No. 5)では基準の数え方が異なり、二次文献の多くは4基準として引用している
  6. 6Ecological Correlations and the Behavior of IndividualsRobinson WS. American Sociological Review. 1950;15(3):351-357(再録 International Journal of Epidemiology. 2009;38(2):337-341, DOI 10.1093/ije/dyn357) · 1950 · accessed 2026-08-25裏付けた主張: 生態学的誤謬を定式化した古典。「In an ecological correlation the statistical object is a group of persons. … The variables are percentages, descriptive properties of groups, and not descriptive properties of individuals」。そして「In each study which uses ecological correlations, the obvious purpose is to discover something about the behavior of individuals. Ecological correlations are used simply because correlations between the properties of individuals are not available. In each instance, however, the substitution is made tacitly rather than explicitly」とし、結論は「…whether ecological correlations can validly be used as substitutes for individual correlations. They cannot」である。Diez-Roux AV. American Journal of Public Health. 1998;88(2):216-222, DOI 10.2105/AJPH.88.2.216 の Table 2 は第一列の見出しが literally「Unit of Analysis」で、生態学的・原子論的・心理学的・社会学的の4つの誤謬を分類する。医療における実証としては Krein SL, Hofer TP, Kerr EA, Hayward RA. Health Services Research. 2002;37(5):1159-1180 が分散分解を行い「the facility effect was at least six times the size of the PCP effect」とし、Hofer TP, et al. JAMA. 1999;281(22):2098-2105, DOI 10.1001/jama.281.22.2098 は「4% or less of the overall variance was attributable to differences in physician practice」とする
  7. 7Evaluating the quality of medical careDonabedian A. The Milbank Memorial Fund Quarterly. 1966;44(3)Suppl:166-206(再録 The Milbank Quarterly. 2005;83(4):691-729) · 1966 · accessed 2026-08-25裏付けた主張: 医療の質評価の古典。帰属の問題を、1966年の時点で既に書いている——「Finally, although outcomes might indicate good or bad care in the aggregate, they do not give an insight into the nature and location of the deficiencies or strengths to which the outcome might be attributed」。また測定の単位について「For hospital care, a single admission is usually the appropriate unit. In office or clinic practice, a sequence of care may cover an indeterminate number of visits so that the identification of the appropriate unit is open to question」「The validity of inferences about the whole will depend, of course, on the extent of internal continuities in the individual or institutional practice of medicine」とする。そして測定者と被測定者の分離について「Errors in diagnostic reports no doubt reflect particularly on … the care provided by the hospital, in general. But the physician may be judged to perform well irrespective of whether the data he works with are or are not valid」と述べる。なお本稿は1966年版(2005年再録)から引いた。よく引用される1988年 JAMA 論文の構造・過程・結果の定義文は本文に到達できていない。またページ範囲がPubMedの166-206と再録本文冒頭の166-203で食い違う
  8. 8Exploring the actionability of healthcare performance indicators for quality of care: a qualitative analysis of the literature, expert opinion and user experienceBarbazza E, Klazinga NS, Kringos DS. BMJ Quality & Safety. 2021;30(12):1010-1020. PMC8606459 · 2021 · accessed 2026-08-25裏付けた主張: 指標が行動につながる条件を整理した論文。Table 3 の Methodological クラスタはちょうど7項目で、各項目が問いの形をとる——「Measures what matters. — Does anybody care?」「Wide engagement. — What can we do?」「Easily interpreted. — Does the indicator signal a clear direction?」「Clear standardisation. — Is the indicator clearly defined and replicable?」「Alignment of accountability. — Are entry points for taking action feasible?」「Measurement matches delivery. — Is the indicator a reflection of the system?」「Sensitive to meaningful change. — Is the indicator sufficiently sensitive to change?」。すなわち七項目・問いの形式・行動可能性の重視という設計が、本サイトの七つの型に先行している。うち Clear standardisation は型1、Alignment of accountability は型6、Sensitive to meaningful change は型5に実質的に対応する
  9. 9On the unintended consequences of publishing performance data in the public sector(Smith 1995 の8つの機能不全)Smith P. International Journal of Public Administration. 1995;18(2-3):277-310 ※本稿は原典に到達しておらず、逐語は Pidd M. International Journal of Productivity and Performance Management. 2005;54(5/6):482-493 経由である · 1995 · accessed 2026-08-25裏付けた主張: 公表される業績データの意図せざる帰結を8つに分類した先行研究——tunnel vision、sub-optimisation、myopia、measure fixation、misrepresentation、misinterpretation、gaming、ossification。すなわち「指標がどう壊れるか」を番号付きで列挙する試みは、本サイトの七つの型に先行する。ただし軸は異なり、Smith が数えるのは「公表され使われることの副作用」であって、測定の妥当性そのものの破綻ではない。同種の列挙として Mannion R, Braithwaite J. Internal Medicine Journal. 2012;42(5):569-574, DOI 10.1111/j.1445-5994.2012.02766.x が20項目を4見出し(poor measurement / misplaced incentives and sanctions / breach of trust / politicisation)に整理している。また Goodhart の法則の原文は「any observed statistical regularity will tend to collapse once pressure is placed upon it for control purposes」で、これも Pidd 2005 経由で確認した
  10. 10International Expert Committee report on the role of the A1C assay in the diagnosis of diabetesInternational Expert Committee. Diabetes Care. 2009;32(7):1327-1334. PMC2699715 · 2009 · accessed 2026-08-25裏付けた主張: HbA1c 6.5% という閾値の導出。「the glycemic level at which the prevalence of 'any' retinopathy begins to rise above background levels … and for the more diabetes-specific 'moderate' retinopathy, was 6.5%」「Among the >20,000 subjects who had A1C values <6.5%, 'moderate' retinopathy was virtually nonexistent」「The receiver operating characteristic curve analysis of the same data indicated that the optimal cut point for detecting at least moderate retinopathy was an A1C of 6.5%」。すなわちアウトカム(網膜症の立ち上がり)から導出されている。そして同じ文書が、退けた方法を名指しする——旧来の基準は「relied on distributions of glucose levels, rather than on the relationship of glucose levels with complications」であり、「an arbitrary decision has been made as to what level justifies the diagnosis of diabetes」と認めていた、と。すなわち分布由来の線とアウトカム由来の線の対比が、ガイドライン委員会自身の文書に並べて書かれている。ただし同じ文書は適用外の集団も列挙しており、「If A1C testing is not possible owing to patient factors that preclude its interpretation (e.g., hemoglobinopathy or abnormal erythrocyte turnover) … previously recommended diagnostic measures … should be used」とする(妊娠、ヘモグロビン異常症、溶血性貧血、慢性マラリア、輸血後)
  11. 11Transparent Reporting of a multivariable prediction model for Individual Prognosis Or Diagnosis (TRIPOD): Explanation and ElaborationMoons KGM, Altman DG, Reitsma JB, Ioannidis JPA, Macaskill P, Steyerberg EW, Vickers AJ, Ransohoff DF, Collins GS. Annals of Internal Medicine. 2015;162(1):W1-W73 · 2015 · accessed 2026-08-25裏付けた主張: 臨床予測モデルの報告指針の解説文。リスク群の作り方について「There is no clear consensus on how to create risk groups, or indeed how many groups to use」「Such groupings, although arbitrary, may become standardized despite lacking any rationale (for example, for the Nottingham Prognostic Index)」「In a few cases, the risk groups may be formed based on external knowledge that suggests a different treatment or management plan based on specific risk thresholds... In most cases, however, there is no such explicit guidance based on estimated probabilities」とする。掲載例には分布由来のもの(「placing cut points at the 25th and 75th percentiles of the model's risk score distribution」「on the basis of PI distribution tertiles」)とアウトカム由来のもの(「Score thresholds for ruling in and ruling out heart failure were introduced based on clinically acceptable probabilities of false-positive (20% and 30%) and false-negative (10% and 20%) diagnoses」)が並ぶ。また適格基準について Item 5b は「Describing eligibility criteria is important to understand the potential applicability, and thus generalizability, of the prediction model. The selection process, describing who did or did not become a study participant, has implications regarding to whom the study results and predictions might be generalized」とする
  12. 12Distribution- and anchor-based methods to determine the minimally important difference on patient-reported outcome questionnaires in oncology: a structured reviewOusmen A, Touraine C, Deliu N, Cottone F, Bonnetain F, Efficace F, Brédart A, Mollevi C, Anota A. Health and Quality of Life Outcomes. 2018;16(1):228. PMC6288886 · 2018 · accessed 2026-08-25裏付けた主張: 臨床的に意味のある最小差をどう決めるかの方法論レビュー。「These methods are generally grouped into two categories, namely anchor-based and distribution-based approaches. The anchor-based approaches use an external indicator, called an 'anchor' … Distribution-based approaches are based on statistical criteria from the PRO scores. These approaches include fractions of the standard deviation (SD) of PRO scores, the effect size, and the standard error of measurement (SEM) as estimates for the MID. Distribution-based approaches have the advantage of simplicity of use, since they do not require an external criterion」。すなわち分布法が選ばれる理由として文献が挙げるのは「外部基準を必要としないこと」であって、対象集団の広さではない。関連する定式化として、臨床検査領域の Reference Interval と Clinical Decision Limit の区別(Ozarda Y, Sikaris K, Streichert T, Macri J. Critical Reviews in Clinical Laboratory Sciences. 2018;55(6):420-431, DOI 10.1080/10408363.2018.1482256——「RIs describe the typical distribution of results seen in a healthy reference population while CDLs are associated with a significantly higher risk of adverse clinical outcomes」)、閾値をアウトカムと効用から導く決定分析(Pauker SG, Kassirer JP. New England Journal of Medicine. 1980;302(20):1109-1117, DOI 10.1056/NEJM198005153022003)、対象を絞ることが診断特性を変えるスペクトラム効果(Ransohoff DF, Feinstein AR. New England Journal of Medicine. 1978;299(17):926-930, DOI 10.1056/NEJM197810262991705)がある
  13. 13Derivation of a simple clinical model to categorize patients probability of pulmonary embolism: increasing the models utility with the SimpliRED D-dimerWells PS, Anderson DR, Rodger M, Ginsberg JS, Kearon C, Gent M, Turpie AG, Bormanis J, Weitz J, Chamberlain M, Bowie D, Barnes D, Hirsh J. Thrombosis and Haemostasis. 2000;83(3):416-420. PMID 10744147 · 2000 · accessed 2026-08-25裏付けた主張: 同一の論文の中に、由来の異なる二種類のカットオフが置かれている。「Cut points on the new rule were determined to create two scoring systems. In the first scoring system patients were classified as having low, moderate and high probability of PE with the proportions being similar to those determined in our original study. The second system was designed to create two categories, PE likely and unlikely. The goal in the latter was that PE unlikely patients with a negative D-dimer result would have PE in less than 2% of cases」。すなわち低・中・高の三分(2.0/6.0)は元研究の分布割合に合わせたもので、likely/unlikely の二分(4.0)は失敗率2%未満というアウトカム目標から逆算されたものである。なお本稿は抄録を確認したが本文には到達していない。また同じ「代替診断」の項目が、肺塞栓版では「no alternative diagnosis (3.0)」、深部静脈血栓版では「Alternative Diagnosis at least as likely as DVT −2」と符号も重みも逆である。信頼性については Rodger MA, Maser E, Stiell I, Howley HE, Wells PS. Thrombosis Research. 2005;116(2):101-107, DOI 10.1016/j.thromres.2004.10.011 が「Pretest probability assessment was not reliable when using physician's gestalt (kappa=0.33), but produced substantial interobserver reliability using the explicit clinical model (kappa=0.62)」とし、明示モデルを擁護する結論である
  14. 14人口動態調査令 第2条・第3条、および戸籍法 第49条・第86条昭和二十一年勅令第四百四十七号/昭和二十二年法律第二百二十四号(e-Gov 法令検索、法令APIで条文単位取得) · 2026 · accessed 2026-08-25裏付けた主張: 人口動態統計の原資を定める。第2条第1項は「人口動態調査資料は、出生、死亡、死産、婚姻及び離婚につき、その届出を受けた市町村長が作成する人口動態調査票とする」、第2項は「人口動態調査票は、出生票、死亡票、死産票、婚姻票及び離婚票の五種とする」。第3条は「市町村長は、戸籍法による届書又は昭和二十一年厚生省令第四十二号による届書その他の関係書類に基づいて、厚生労働大臣の定めるところにより、人口動態調査票を作成しなければならない」とする。すなわち原資は戸籍という台帳そのものではなく届書であり、出生票と死亡票は別々の調査票である。両者は突合されておらず、死亡票に死亡者の生年月日が記載されるため引き当てる必要がない。したがって乳児死亡率は独立に集計された二つの総数の比であって、コホート追跡ではない。戸籍法第49条第1項は出生の届出を「十四日以内(国外で出生があつたときは、三箇月以内)」、第86条第1項は死亡の届出を「死亡の事実を知つた日から七日以内(国外で死亡があつたときは、その事実を知つた日から三箇月以内)」と定める。なお死産のみは戸籍法ではなく昭和二十一年厚生省令第四十二号(死産の届出に関する規程)に基づき、その第2条は「この規程で、死産とは妊娠第四月以後における死児の出産をいひ」とする(厚生労働省はこれを「妊娠満12週(妊娠第4月)以後」と読み替えている)
  15. 15人口動態調査 調査の概要/令和6年(2024)人口動態統計(確定数)の概況厚生労働省 · 2026 · accessed 2026-08-25裏付けた主張: 調査の性格についての記述。「回答率について 市区町村に提出された届出をそのまま転記することで調査票が作成されているため、全ての調査項目に回答している。回収率について 人口動態調査は、回答者に調査票を送付し、回答が記入された調査票を回収するものではなく、市区町村が届出を受理した場合に調査票が作成されるため、回収率という概念は存在しない」。また人口動態調査Q&Aは「Q.目標母集団と実際に利用している母集団フレームには、どの程度の差異がありますか。A. 人口動態調査では、市区町村に提出された届出について、必ず調査票が作成されるため、差異は発生しません」とする。ただし目標母集団が「提出された届出」と定義されているため、未届出の出生は定義上カバレッジ誤差として現れない(この読み方は本稿の解釈である)。集計客体については「本概況は、令和6年1年間に日本において発生した日本人の事象を客体としている」とし、日本における外国人・外国における日本人・前年以前発生のものは別掲とする。令和6年の別掲値は出生数で外国人22,878、在外邦人10,725、前年以前発生1,103の計34,706で、本表の出生686,173に対し4.81%にあたる(この計算は本稿によるもので、厚生労働省の公表値ではない)。在日外国人を分子・分母とも足し戻すと乳児死亡率は1.845から1.846になり、ほとんど動かない。なお算式は「乳児死亡率=年間乳児死亡数(生後1年未満の死亡数)/年間出生数×1,000」で、コホート補正は行われていない。ただし年報の統計表には「出生数・死亡数及び乳児(1歳未満)死亡数,性・出生年-死亡年別」が存在し、対応を集計することは可能である。また届出だけで完結するのは乳児死亡率・新生児死亡率・早期新生児死亡率の3つで、出生率・粗死亡率・合計特殊出生率・婚姻率はいずれも分母に総務省統計局の人口推計を用いる
  16. 16乳児死亡率の国際比較に関する研究サンタマリア M, 加納克己, 山口誠哉, 久保武士. 民族衛生. 1990;56(1):47-54 · 1990 · accessed 2026-08-25裏付けた主張: 日本の乳児死亡率の国際比較を補正した研究。抄録は「日本の周産期死亡は諸外国に比べ,特に後期死産率が早期新生児死亡率よりもかなり高い.早期新生児死亡と数えるべき死亡を後期死産に数えると,乳児死亡率に影響を与える.そこで,1987年のWHO発行の統計年報に記載された47力国の後期死産数,早期新生児死亡数,出生数,乳児死亡数を用い,後期死産数と早期新生児死亡数の比率を諸外国のデータの平均値と仮定したときに,日本のほか諸外国の乳児死亡率がどのように変化するか計算した」とする。1984年のデータで日本の後期死産・早期新生児死亡比は2.03であり、米国1.01・スウェーデン1.24・フィンランド1.11と比べて突出して高い。補正の結果、日本の乳児死亡率は6.0から7.45に上がる(フィンランド6.5→6.64、スウェーデン6.4→6.73、米国11.9→11.86)。本文は「Among the 47 considered countries, 12 of them (i.e. France, Japan, etc.), increase the IMR after the correction (CIMR), while 7, decreased this variable」とする。1990年発表・1984年データ・手法は比率標準化・被引用0という限界があるが、「定量した研究が存在する」ことは確かにする。関連して Smith LK, Morisaki N, Morken NH, Gissler M, Deb-Rinker P, Rouleau J, Hakansson S, Kramer MR, Kramer MS. Pediatrics. 2018;142(1):e20173324, DOI 10.1542/peds.2017-3324 は7か国(日本 n=2,288 を含む)の22〜25週の出生を比較し「For births at 22 weeks' gestation, neonatal survival rates for which we used live births as the denominator varied from 3.7% to 56.7% among the 7 countries … the variation arises in part from differences in the proportion of births reported as live births, which itself is closely connected to the provision of active care」とする。ただし逆向きの結論もあり、Kim DH, Jeon J, Park CG, Sriram S, Lee KS. Journal of Korean Medical Science. 2016;31(9):1450-1454, DOI 10.3346/jkms.2016.31.9.1450 は「If Koreans and Japanese had the same BWD as in the U.S., their crude NMR/IMR would be … 1.5/2.5 for the Japanese」とし、日本の低さは主に出生体重別死亡率すなわち医療の質によるとする
  17. 17Variations in Cesarean Delivery for First Births and Neonatal Survival at 22-25 Weeks' Gestation: An International ComparisonPediatrics 142(1):e20173324 (Smith LK, Morisaki N, Morken NH, Gissler M, Deb-Rinker P, Rouleau J, Hakansson S, Kramer MR, Kramer MS) · 2018 · accessed 2026-08-25裏付けた主張: 日本(n=2,288)を含む7か国の22〜25週の出生を比較した国際研究。「For births at 22 weeks' gestation, neonatal survival rates for which we used live births as the denominator varied from 3.7% to 56.7% among the 7 countries … the variation arises in part from differences in the proportion of births reported as live births, which itself is closely connected to the provision of active care」と報告する。すなわち生存率の国際差の一部は、生産として届け出られる割合の違いから生じており、それ自体が積極的治療を提供するかどうかと結びついている。乳児死亡率の国際比較において、分子・分母の境界が臨床判断と制度に依存することを示す例である
  18. 18OECD Health Statistics 2025 — Definitions, Sources and Methods(Infant mortality)/WHO Global Health Observatory の指標メタデータOECD / World Health Organization · 2026 · accessed 2026-08-25裏付けた主張: 国際機関側の注記。OECDの総論は「Some of the international variation in infant and neonatal mortality rates may be due to variations among countries in registering practices of premature infants. Most countries have no gestational age or weight limits for mortality registration. However, some countries specify limits based on some combination of gestational age, birth weight or survival」とする。日本の項は「The live births are registered regardless of gestation period, so very premature babies are registered as live births」であり、生産の定義については日本は国際基準どおりである。そしてOECDは「Minimum threshold of 22 weeks」という別系列を41か国から収集している——すなわち比較可能性を高めるため妊娠22週以上に揃えた別系列も収集しているが、「素の値は比較できないと判断した」とまで文書に書かれているわけではない。WHOの指標メタデータはさらに踏み込む——「Infant mortality rate is strictly speaking not a rate … but a probability of death derived from a life table and expressed as rate per 1000 live births」「These infant mortality rates have been estimated by applying methods to all Member States to the available data from Member States, that aim to ensure comparability of across countries and time; hence they are not necessarily the same as the official national data」「Predominant type of statistics: adjusted and predicted」。すなわち厚生労働省が公表する1.8とWHOが公表する日本の乳児死亡率は、そもそも同じ量ではない
  19. 19The Apgar Score(Committee Opinion No. 644、2025年再確認)American College of Obstetricians and Gynecologists / American Academy of Pediatrics. Obstetrics & Gynecology. 2015;126:e52-e55, DOI 10.1097/AOG.0000000000001108 · 2025 · accessed 2026-08-25裏付けた主張: 学会自身がスコアの適用範囲を制限する文書。「The Apgar score alone cannot be considered to be evidence of or a consequence of asphyxia, does not predict individual neonatal mortality or neurologic outcome, and should not be used for that purpose」「It is inappropriate to use the Apgar score alone to establish the diagnosis of asphyxia」。定義の揺れも学会自身が挙げる——「There are numerous factors that can influence the Apgar score, including maternal sedation or anesthesia, congenital malformations, gestational age, trauma, and interobserver variability」「Elements of the score such as tone, color, and reflex irritability can be subjective」。評価者間のばらつきの実測として Lopriore E, van Burk GFE, Walther FJ, de Beaufort AJ. BMJ. 2004;329:143-144, DOI 10.1136/bmj.38117.665197.F7 が166名のオランダの小児科専門職に同一の紙上症例を採点させ、「In case 1, the total Apgar score assigned was 6 (16%), 7 (55%), 8 (21%), or 9 (7%)」と報告する。すなわち同じ児が、採点者によって閾値7をまたぐ。なお現行の区分(0–3 / 4–6 / 7–10)は Apgar 自身の1953年の区分(0–2 / 3–7 / 8–10)とは異なり、Chong DS, Karlberg J. Acta Paediatrica. 2004;93:53-59 は976,635件のスウェーデンの出生を用いた ROC 解析から「Our analysis did not support the common practice in the clinic or in research of grouping infants at risk in Apgar score groups, i.e. a score below 4 or a score below 7 … rather than adhering to a historical cut-off value that has not been studied in depth」と結論する
  20. 202500-g Low Birth Weight Cutoff: History and Implications for Future Research and PolicyHughes MM, Black RE, Katz J. Maternal and Child Health Journal. 2017;21(2):283-289. PMC5290050 · 2017 · accessed 2026-08-25裏付けた主張: 低出生体重の閾値2500gの来歴。「Dr. Arvo Ylppö, a Finnish pediatrician, first proposed the 2500 g cutoff in 1919... While he provided no justification for this specific weight cutoff, it has become the global marker for low birth weight」「In 1920 Schwarz and Kohn analyzed low birth weight stating 'we have arbitrarily made 2500 g or under, the weight designated as low birth weight'」。すなわち根拠が示されないまま置かれた線が、世界標準になった。指標としての性質については Hennessy D, et al. Public Health Research & Practice. 2022;32:31122106, DOI 10.17061/phrp31122106 が「it conflates preterm birth and intrauterine growth restriction, which have different causal pathways」とし、さらに「The proportion of low-birthweight births remained constant over time, while the proportion of births that were preterm increased and proportion of SGA decreased」と報告する。すなわち指標が動かないまま、その二つの構成要素が逆方向に動いた
  21. 21eGFR 60 という閾値の来歴と、その後のデータK/DOQI Clinical Practice Guidelines for Chronic Kidney Disease (2002), p.45 / Matsushita K, et al. Lancet. 2010;375(9731):2073-2081. PMC3993088 / KDIGO 2024 Clinical Practice Guideline for CKD · 2024 · accessed 2026-08-25裏付けた主張: 閾値が先に置かれ、アウトカムのデータが8年後に来た例。K/DOQI 2002 の根拠は算術である——「The rationale for including these individuals is that reduction in kidney function to this level or lower represents loss of half or more of the adult level of normal kidney function, which may be associated with a number of complications」。2010年の大規模プール解析は「mortality risk was unrelated to eGFR between 75-105 ml/min/1·73 m and increased at lower eGFR. Adjusted hazard ratios... at eGFR 60... were 1·18 (95% CI: 1·05-1·32)」とし、結論を「Altogether the findings in this analysis are consistent with the current KDOQI thresholds」と述べる。すなわち「データが60を特定した」のではなく「既存の閾値と整合的である」という形である。KDIGO 2012 は2010年のデータの後も同じ算術的根拠を繰り返し、「A GFR <60 ml/min/1.73 m2 is less than half of the normal value in young adult men and women... Figure 2 shows a compilation of GFR measurements in apparently healthy men and women... from more than 40 years ago」とする。そして KDIGO 2024 は測定法を変えると変曲点が消えることを書いている——「eGFRcr exhibited a J-shaped association such that risk increased with eGFR values over 105... In contrast, eGFRcr-cys demonstrated much more linear associations with each of these complications throughout its distribution」。また同じ2024年版で小児の低GFRのカットオフを60から90へ変更し、理由を「A higher cutoff defining low GFR for children and adolescents also reflects their longer life expectancy」とする
  22. 222024 ESC Guidelines for the management of atrial fibrillation developed in collaboration with the European Association for Cardio-Thoracic Surgery (EACTS)Van Gelder IC, et al. European Heart Journal. 2024;45(36):3314-3414 · 2024 · accessed 2026-08-25裏付けた主張: CHA2DS2-VASc の閾値の格付け。2020年版(Hindricks G, et al. European Heart Journal. 2021;42(5):373-498, DOI 10.1093/eurheartj/ehaa612)は「OAC is recommended for stroke prevention in AF patients with CHA2DS2-VASc score ≥2 in men or ≥3 in women」を Class I / Level A で示していたが、2024年版は「A CHA2DS2-VA score of 2 or more is recommended as an indicator of elevated thromboembolic risk for decisions on initiating oral anticoagulation」を Class I / Level C とする。同ガイドラインの定義では Level C は「Consensus of opinion of the experts and/or small studies, retrospective studies, registries」である。本文はさらに「Although most available stroke risk scores are simple and practical, the predictive value of scores is generally modest … Classification and discrimination of adverse events is relatively poor for all scores and hence the benefit of using them to select patients for OAC is unclear」とし、「This guideline continues to provide a Class IA recommendation for the use of OAC in patients at risk of thromboembolism. However, in the absence of strong evidence for how to apply risk scores in real-world patients, this has been separated from the use of any particular risk score」と、推奨をスコアから切り離した。年齢項目については「Age is an independent determinant of ischaemic stroke risk. Age-related risk is a continuum, but for reasons of practicality, two points are given for age ≥75 years」と、実務上の便宜であることを明記する。また「The absolute risk level at which to start OAC in individual patients cannot be estimated from population-level studies」とも述べる。同じスコアが同じ絶対リスクを指さないことは Quinn GR, Severdija ON, Chang Y, Singer DE. Circulation. 2017;135(3):208-219, DOI 10.1161/CIRCULATIONAHA.116.024057 が示しており、「At a CHA2DS2-VASc score of 2, 27% of cohorts reported stroke rates below 1% per year, 40% reported stroke rates between 1 and 2% per year, and 33% reported stroke rates >2% per year」とする
  23. 23Glasgow Coma Scale の言語成分の欠落と、その埋め方Fischer M, Rüegg S, Czaplinski A, Strohmeier M, Lehmann A, Tschan F, Hunziker PR, Marsch SC. Critical Care. 2010;14:R64. PMC2887186 / Meredith W, Rutledge R, Fakhry SM, Emery S, Kromhout-Schiro S. Journal of Trauma. 1998;44(5):839-844, DOI 10.1097/00005373-199805000-00016 · 2010 · accessed 2026-08-25裏付けた主張: GCSは言語反応を要素に含むため、挿管・鎮静下では測れない。Meredith らは「requires a verbal response. In some series, up to 50% of injured patients must be excluded from analysis because of lack of a verbal component for the GCS」とする。欠落の埋め方は二通りある。第一は定数を置くこと——Fischer らは「In intubated patients, the rating for the verbal domain of the GCS was defined to be 1」とし、「In the ICU, a variety of conditions such as intubation, sedation, or delirium preclude a reliable assessment of a verbal response」と述べる。第二は回帰で推定すること——Meredith らは「Derived Verbal Score = -0.3756 + Motor Score * (0.5713) + Eye Score * (0.4233)」という式を示し、そして「the derived GCS performed better than the actual GCS by several measures」と報告する。すなわち測らなかった項目を推定したほうが、観測したものより予測が良かった。合計点の性質については Brennan PM, Murray GD, Teasdale GM. Journal of Neurosurgery. 2018;128:1612-1620, DOI 10.3171/2017.12.JNS172780 が「The increase in mortality and unfavorable outcome observed at a GCS score of 4 compared with a GCS score of 3 has been reported in other papers... The reason for this paradoxical finding is unclear」とし、Teasdale G, et al. Lancet Neurology. 2014;13:844-854 は「Individual patients are best described by the three components of the coma scale; whereas the derived total coma score should be used to characterise groups」とする。13/14の境界については Mena JH, et al. Journal of Trauma. 2011;71:1185-1193, DOI 10.1097/TA.0b013e31823321f8 が「We found that the odds of mortality for GCS score of 13 are closer to a GCS score of 12 rather than a GCS score of 14」とし、外部の分類体系(ATLS)による再区分を支持しないと結論する
  24. 24病院標準化死亡比の信号対雑音比と、質との関係Girling AJ, Hofer TP, Wu J, Chilton PJ, Nicholl JP, Mohammed MA, Lilford RJ. BMJ Quality & Safety. 2012;21(12):1052-1056 / Hogan H, et al. BMJ. 2015;351:h3239 · 2015 · accessed 2026-08-25裏付けた主張: 施設単位の死亡指標の性能。Girling らは「at least 10 warnings out of 11 would be false alarms」とする。Hogan らは英国の病院で回避可能死亡の割合を実測し「The proportion of avoidable deaths was 3.6%」「a small but statistically non-significant association between HSMR and the proportion of avoidable deaths (regression coefficient 0.3, 95% CI −0.2 to 0.7)」とし、「any metric based on mortality is unlikely to reflect the quality of a hospital」と結論する。標本規模の問題については Dimick JB, Welch HG, Birkmeyer JD. JAMA. 2004;292(7):847-851 が「Minimum hospital caseloads necessary to detect a doubling of the mortality rate were... 86 for pancreatic resection... and 2668 for hip replacement」とし、「only a small proportion of hospitals met the minimum caseload: ... pancreatic resection (2%), esophageal resection (1%), and hip replacement (<1%)」とする。交絡調整そのものの危険については Mohammed MA, et al. BMJ. 2009;338:b780 が、症例構成の調整に用いられる変数の一部は「unsafe for case mix adjustment because their inclusion may actually increase the very bias that case mix adjustment is intended to reduce」とする
  25. 25Influence of definition based versus pragmatic birth registration on international comparisons of perinatal and infant mortality: population based retrospective studyJoseph KS, Liu S, Rouleau J, Lisonkova S, Hutcheon JA, Sauve R, Allen AC, Kramer MS. BMJ. 2012;344:e746 · 2012 · accessed 2026-08-25裏付けた主張: 出生登録の実務の違いが、国際比較を歪めることを示した研究。「The proportion of live births under 500 g varied widely from less than 1 per 10,000 live births in Belgium and Ireland to 10.8 … in Canada and 16.9 in the United States」「International differences in reported rates of extremely low birthweight and very early gestation births probably reflect variations in registration of births and compromise the validity of international rankings of perinatal and infant mortality」「Rankings of countries based on crude fetal, neonatal, and infant mortality rates differed substantially from rankings based on rates calculated after exclusion of births with a birth weight of less than 1000 g or a gestational age of less than 28 weeks」。すなわち「死んだか、死ななかったか」という二値であっても、分母に「生産」として入るかどうかが登録の判断である以上、国際比較は歪む。関連して Kramer MS, et al. Paediatric and Perinatal Epidemiology. 2002, DOI 10.1046/j.1365-3016.2002.00390.x は「Reported proportions of live births <500 g varied 50-fold … International comparisons and rankings of infant mortality should be interpreted with caution」とする
  26. 26Canadian C-Spine Rule study for alert and stable trauma patients: I. Background and rationale / The Canadian C-spine rule for radiography in alert and stable trauma patientsStiell IG, et al. Canadian Journal of Emergency Medicine. 2002;4(2):84-90 / Stiell IG, et al. JAMA. 2001;286(15):1841-1848, DOI 10.1001/jama.286.15.1841 · 2002 · accessed 2026-08-25裏付けた主張: 臨床決断ルールの設計者自身による、適格基準についての記述。背景論文は「Eligibility criteria have often been unclear in previous studies, making it difficult for readers to interpret and apply the findings to their own patients. Most studies lacked a standardized patient definition, enrolling any trauma patient who had C-spine films ordered at the treating physician's discretion. … Only 2 studies specified that subjects should be adults; the rest did not report age restrictions」とする。JAMA 2001 の本文は10項目の除外基準を定めており、16歳未満、GCS 15未満、受傷から48時間超、穿通性外傷、急性麻痺、既知の椎体疾患、同一外傷での再来、妊娠などを外す。ただし著者らは除外された集団についてルールが適用できないとは書いておらず、逆に「The study subjects were selected without bias and based on preset criteria rather than on the subjective decision of individual physicians to order C-spine radiography. These patients represented a wide spectrum of clinical characteristics and geographic sites, hence increasing generalizability」と一般化可能性を主張する。また同グループの方法論基準も「The subjects in the study should be selected without bias and should represent a wide spectrum of characteristics to increase generalizability」とし、広いスペクトラムを達成目標として扱う。なお論文に報告されているのは適格判定後の内訳(未登録3,281名、追跡不能577名)であり、除外基準によって適格判定の前に外れた人数は報告されていない

関連記事 RELATED