Top 5 This Week

関連記事

【医療統計版】18. 区間打ち切り:検査の日付をイベント日として使ってよいか

- 本サイト運営者のサービスの紹介 -

3か月ごとのCTで進行を判定する試験では、進行が見つかった日付がデータに入ります。ただしその日に進行したわけではありません。前回の検査では進行がなく、今回はあった。分かっているのはこの区間だけです。

同じ構造は、定期検査で捉える事象全てにあります。糖尿病網膜症の発症、移植後の慢性拒絶、抗体の陽転。臨床で「いつ起きたか」が連続的に観察できる事象は、実は多くありません。

分かっているのは区間だけ

3名の患者について、真のイベント時刻、記録される検出日、実際に分かっている区間を示した模式図。真の時刻は前回評価と今回評価のあいだにある。
図1 三角が真の発生時刻、バツが記録される日付です。データに残るのはバツのほうで、実際に分かっているのは水色の区間です。区間の幅が検査間隔になります。

検出日をそのままイベント日として扱うと、全員のイベント時刻が後ろにズレます。生存曲線は上に持ち上がり、中央値は長めに出ます。

真のイベント時刻による生存曲線と、検出日を使った生存曲線を重ねた図。後者が上に位置している。
図2 破線が真のイベント時刻による曲線、実線が検出日を使った曲線です。実線が一貫して上にあります。中央値でいうと真の15.3か月・20.2か月が、18か月・21か月として記録されます。

この上振れは検査間隔の半分程度になります。3か月ごとなら平均1.5か月ぶんです。他試験の中央値と比べるとき、検査間隔が違えばこの分だけ差が出ます。中央値の比較で「この試験のほうが成績が良い」と述べる前に、両試験の評価スケジュールを確認する必要があります。

間隔が群で違うと結論が動く

上振れは両群に等しくかかるので、群間比較には効かないように思えます。実際、間隔が同じなら問題ありません。

3つの評価スケジュールでハザード比を比べた棒グラフ。両群同じ間隔なら一致するが、間隔が群で違うと検出日を使った推定が0.69や0.61に偏る。
図3 両群3か月なら0.648で正しく推定できます。対照群だけ6か月にすると0.691、逆に治療群だけ6か月にすると0.609。真値は0.65です。区間打ち切りとして扱えば、どの場合も0.647前後になります。

検査が少ない群では進行の発見が遅れ、その群の成績が良く見えます。図3では対照群を6か月にしたときに効果が過小評価され、治療群を6か月にしたときに過大評価されました。方向が逆になるので、どちらに偏るかは設計次第です。

実務で問題になるのは、規定は同じでも運用が違う場合です。治療群は通院頻度が高く、ついでに撮影される。対照群は来院が減り、規定の検査が遅れる。この差が積み重なると、図3の右側や中央の状況になります。

区間を尤度に載せる

対処は、区間そのものを尤度に書くことです。イベントが区間$(L, U]$で起きたと分かっているなら、その確率は

$$P(L < T \le U) = S(L) – S(U) \tag{1}$$

です。右打ち切りなら$S(L)$、正確な観測なら密度$f(t)$を使います。式(1)を各患者について掛け合わせたものが尤度になります。

$$\mathcal{L} = \prod_{i \in \textrm{区間}} \{S(L_i) – S(U_i)\} \prod_{i \in \textrm{打ち切り}} S(L_i) \tag{2}$$

式(2)を最大化します。部分尤度はイベント時刻の順序で構成されるので、この形をそのままは扱えません。順序が確定しないためです。分布を仮定するパラメトリックモデルなら素直に書けます。

library(survival)

survreg(Surv(lower, upper, type = "interval2") ~ trt, data = d, dist = "weibull")

lowerは前回の評価時点、upperは今回の評価時点です。イベントが起きていない患者はupperをInfにします。Surv関数がこの形を受け取り、式(2)の尤度を組み立てます。

分布を仮定したくないなら、Turnbull推定量というノンパラメトリックな方法があります。Kaplan-Meier推定量の区間打ち切り版にあたるもので、icensパッケージやintervalパッケージで計算できます。ただし曲線は区間の端でしか決まらず、途中は不定になります。

共変量を入れたセミパラメトリックな推定も研究されており、icenRegパッケージなどで使えます。Cox回帰と同じ感覚で使える形になっていますが、標準的なCox回帰ほど実装が枯れていないので、結果はパラメトリックモデルと突き合わせて確かめることを勧めます。

どこまで気にするか

検査間隔が生存時間の中央値に比べて短ければ、影響は小さくなります。中央値20か月に対して1か月ごとの検査なら、上振れは0.5か月程度です。この場合、検出日をそのまま使っても実害は出ません。

問題になるのは、間隔が中央値の1割を超えるあたりからです。中央値12か月で3か月ごとの検査なら、間隔が中央値の4分の1を占めます。図2の状況がこれで、中央値が3か月ほど動きました。

私が相談を受けたときの判断は、まず群間で間隔が揃っているかを確かめ、揃っていれば中央値の解釈に注意を促すに留めます。揃っていない、あるいは実際の検査日にばらつきが大きいなら、区間打ち切りとして解析し直すことを勧めます。

ノンパラメトリックに推定する

分布を仮定せずに曲線を描きたい場合は、Turnbull推定量を使います。Kaplan-Meier推定量を区間打ち切りに拡張したもので、各患者の区間を重ね合わせ、確率が置かれうる区間だけを取り出して反復計算で推定します。

出力の見た目は独特です。曲線は階段状になりますが、段の位置が「ここで下がる」ではなく「この区間のどこかで下がる」という意味になり、区間の内部では値が定まりません。図に描くと、確定した水平部分と、不確定な垂直の帯が交互に現れます。

この不定区間は、検査間隔が長いほど広くなります。3か月ごとの評価なら3か月幅の帯が並ぶので、中央値を読み取ろうとしても幅を持った答えしか出ません。中央値を1点で報告したいなら、パラメトリックモデルを当てるか、区間の端をどう扱うかの規則を決めることになります。

Rではicensパッケージやintervalパッケージで計算できます。intervalパッケージには区間打ち切り版のログランク検定にあたるictest関数もあり、群間比較を分布の仮定なしに行えます。

現在状態データという極端な場合

検査が1回しかない研究では、区間打ち切りの極端な形になります。ある時点で調べて、既に発症していたか、まだだったかだけが分かる。発症時刻については、その時点より前か後かという情報しかありません。

横断調査で有病率から発症率を推定する場面や、動物実験で剖検時に病変の有無を見る場面がこれにあたります。各個体から得られる情報が2値なので、通常の生存時間解析より必要な標本数が大きくなります。

この構造は現在状態データと呼ばれ、区間打ち切りの理論がそのまま当てはまります。検査時点が個体ごとに散らばっていることが推定の前提で、全員を同じ時点で調べると発症時刻の分布は推定できません。

データの持ち方

解析を区間打ち切りで組むなら、データ抽出の段階で前回評価日を残してもらう必要があります。進行日だけが入ったデータセットからは、区間を復元できません。

必要なのは、各患者の評価日の一覧です。そこから、イベントが確認された評価日と、その直前の評価日を取り出します。評価が飛んでいる患者では区間が長くなりますが、それが実態なので、そのまま扱います。

後ろ向き研究では、検査のタイミングが患者ごとにばらばらです。定期検査の規定がないので、症状が出たときに撮影されることも多い。この場合、区間の幅そのものが予後の情報を持ちます。区間打ち切りの標準的な手法は、検査のタイミングがイベント時刻と独立であることを仮定しているので、ここが成り立ちません。対処は難しく、まずは検査間隔の分布を群別に記述して、偏りの向きを議論することになります。

後ろ向きデータでの難しさ

前向き試験なら評価日が規定されていますが、後ろ向き研究では検査のタイミングが患者ごとにばらばらです。定期検査の規定がないので、症状が出たときに撮影されることが多くなります。

この場合、区間の幅そのものが予後の情報を持ちます。頻繁に検査されている患者は、何か気になる所見があった患者です。区間打ち切りの標準的な手法は、検査のタイミングがイベント時刻と独立であることを前提にしているので、ここが崩れます。

厳密な対処は難しく、検査過程を明示的にモデル化する枠組みが要ります。実務的には、検査間隔の分布を群別に記述して偏りの向きを議論するところまでが現実的でしょう。治療群のほうが検査が密なら、その群の事象が早く見つかるので効果は過小評価される、という向きです。

報告の仕方

評価スケジュールを書きます。規定の間隔、群間で同じかどうか、そして実際の間隔の中央値と範囲。規定と実態がズレていれば、そのことも書きます。

区間打ち切りとして解析したなら、その旨と使った分布、そして検出日をイベント日とした場合の結果も併記します。両者が近ければ、間隔の影響が小さかったことの証拠になります。

中央値を報告するときは、それが検査間隔に依存する量であることを1文添えます。他試験との比較を読者がするときの手がかりになります。

群間で間隔が違った場合は、その差と、どちらの方向に偏りうるかを考察に書きます。図3のとおり方向は決まっているので、偏りの向きは特定できます。

次に確かめること

この問題は無増悪生存期間で最も表面化します。イベント定義や打ち切り規則の全体像はエンドポイントの定義で扱いました。

区間打ち切りを扱えるパラメトリックモデルの一般論はAFTモデルパラメトリック生存モデルにあります。打ち切りの種類そのものの整理は打ち切りと左切断です。

検査タイミングが予後と関係する場合は、情報のある観察過程の問題になり、結合モデルの枠組みが関係してきます。

検査間隔をどう設計するか、既存データを区間打ち切りとして解析し直すべきか。このあたりは検査の運用実態を見ないと決まりません。Dr.データサイエンスでは、こうした解析設計のご相談を承っています。

参考文献

Turnbull BW. The empirical distribution function with arbitrarily grouped, censored and truncated data. Journal of the Royal Statistical Society: Series B. 1976;38(3):290-295.

Sun J. The Statistical Analysis of Interval-censored Failure Time Data. Springer; 2006.

Panageas KS, Ben-Porat L, Dickler MN, Chapman PB, Schrag D. When you look matters: the effect of assessment schedule on progression-free survival. Journal of the National Cancer Institute. 2007;99(6):428-432.

Anderson-Bergman C. icenReg: regression models for interval censored data in R. Journal of Statistical Software. 2017;81(12):1-23.

Klein JP, Moeschberger ML. Survival Analysis: Techniques for Censored and Truncated Data. 2nd ed. Springer; 2003.

Popular Articles