Top 5 This Week

関連記事

【医療統計版】22. ランドマーク解析:奏効例と非奏効例を比べてよいか

- 本サイト運営者のサービスの紹介 -

治療に奏効した患者と奏効しなかった患者で、その後の生存を比較することがあります。実際、奏効例のほうが明らかに長く生存していることもあります。この結果を見ると、「奏効したことが予後を改善した」と解釈したくなります。

しかし、ここには構造上の問題があります。患者が「奏効例」と判定されるためには、その判定時点まで生存していなければなりません。早期に亡くなった患者は、実際には奏効する可能性があったとしても、奏効の判定を受ける前に死亡しているため、非奏効例に分類されます。

これは、先ほど時変共変量で扱った不死時間バイアスと同じ構造です。奏効例として分類されるためには、一定期間を生き延びる必要があるからです。

この問題への対処法としてよく用いられるのが、ランドマーク解析です。ここでは、ランドマーク解析によって奏効とその後の生存をどのように評価するのかを見ていきます。

奏効例は必ず生き延びている

4名の患者の追跡線。奏効した2名には奏効までの期間が太い灰色の帯で示され、奏効しなかった2名にはない。6か月の位置にランドマークの縦線が引かれている。
図1 灰色の帯が不死時間です。この期間に亡くなれば非奏効例に分類されるので、奏効例は全員この帯を生き延びています。患者Dのように3か月で亡くなった人は、奏効する機会がありませんでした。

600例の架空データで確かめます。真の設定は「奏効後にハザードが0.7倍になる」で、奏効前後で予後が変わる構造です。

3通りの解析によるハザード比のフォレストプロット。登録時点で群分けすると0.50、時変共変量で0.64、ランドマークで0.71。真値0.70の位置が破線で示されている。
図2 登録時点から奏効の有無で分けると0.50。真値0.70に対し、効果が4割ほど誇張されています。時変共変量では0.64、6か月のランドマークでは0.71でした。

0.50と0.70の差が不死時間によるものです。奏効例には「奏効するまで生きた」という条件が入っているので、その分だけ成績が良く見えます。

基準時点で切り直す

ランドマーク解析の手続きは単純です。基準時点$t_L$を決め、そこまで生存していた患者だけを残します。$t_L$時点での状態で群分けし、$t_L$を新しい原点として生存時間を数え直します。

L  <- 6
dl <- subset(d, tm > L)                  # 6か月まで生存した患者だけ
dl$responder <- as.numeric(dl$tresp <= L)  # 6か月時点での奏効の有無

coxph(Surv(tm - L, status) ~ responder, data = dl)

上記の通り、コードは3行で済み、このシンプルさがランドマーク解析が広く使われる理由です。時変共変量のようにstart-stop形式へ展開する必要がなく、結果も「6か月時点で奏効していた患者の、その後の予後」として説明できます。

不死時間が消える理由も明快です。$t_L$より前に亡くなった患者は両群から等しく除かれるので、奏効例だけが生き延びているという非対称がなくなります。

一方で、失うものもあります。この例では$t_L$より前のイベントは解析から消えるため、600例のうち496例しか残りません。

基準時点をどこに置くか

ランドマーク解析では、ランドマーク時点$t_L$をどこに置くかが結果に影響します。たとえば、3、6、9、12か月をランドマーク時点として、それぞれ解析してみます。

ランドマーク時点を3・6・9・12か月と変えたときのハザード比と、各時点で残る患者数を重ねた図。時点が遅いほど推定値が下がり患者数も減る。
 3か月ではハザード比0.712、12か月では0.623となり、真値0.70から徐々に離れています。同時に、解析対象として残る患者数は544例から407例へ減少し、信頼区間も広がっています。

早いランドマーク時点では、まだ奏効していない患者が非奏効例に含まれます。その後に奏効する患者も含まれるため、奏効例と非奏効例の区別が十分に明確になっていない可能性があります。

一方、ランドマーク時点を遅くすると、奏効の判定はより確定的になります。しかしその代わりに、その時点まで生存していた患者だけを対象とするため、解析対象となる集団そのものが変わります。対象患者数も減少するため、推定の不確実性も大きくなります。

したがって、$t_L$は解析結果を見てから決めるのではなく、臨床的な根拠に基づいて事前に設定することが重要です。たとえば、奏効判定が規定されている時点、治療サイクルの区切り、ガイドラインで評価が推奨されている時点などが候補になります。

また、複数の$t_L$で計算して並べるのは、感度分析としては有用です。図3のように傾向が一貫していれば頑健だと言えますし、時点によって符号が変わるなら結論を保留します。

打ち切りの扱いも変わる

ランドマーク解析では、$t_L$より前に打ち切られた患者も解析対象から除外されます。イベントを起こした患者だけでなく、追跡が途切れた患者も対象から外れることになります。

ここで確認しておきたいのが、$t_L$までの打ち切りが群間で偏っていないかどうかです。たとえば、奏効しなかった患者ほど早く通院をやめるのであれば、非奏効群から予後の悪い患者が抜けることになります。これは、情報的打ち切りで扱った構造が、ランドマーク時点より前に生じていると考えることができます。

この場合、ランドマーク解析によって不死時間バイアスを除去できても、別の偏りが入り込む可能性があります。そのため、$t_L$までの打ち切り率を群別に集計し、群間で大きな差がないかを確認しておくことが重要です。

もうひとつ注意したいのが、$t_L$時点で奏効状態が確認できない患者の扱いです。奏効判定が行われていなかったり、必要な検査が欠けていたりする場合があります。こうした患者を非奏効として扱うのか、それとも解析から除外するのかによって、結果は変わり得ます。したがって、こうした扱いは事前に規則を決めておき、両方の定義による感度分析を行うのが安全です。

時変共変量との使い分け

どちらの方法でも不死時間バイアスを避けることができます。違いは、何を問いとしているかです。

時変共変量では、状態が変化した時点からハザードがどう変わるかをモデル化します。つまり、「奏効した直後から予後が変わるのか」という問いに答える方法です。観察期間中の全てのイベントを解析に利用できるため、ランドマーク解析のように$t_L$より前の情報を切り捨てる必要がありません。

一方、ランドマーク解析では、ある時点での状態を起点として、その後の予後を評価します。「6か月時点で奏効している患者は、その後どのような見通しなのか」という問いに対応します。これは臨床現場で、その時点までに得られた情報をもとに患者の予後を考える状況に近い方法です。

実務上の違いは、必要なデータにも表れます。時変共変量を使うには、状態が変化した日付を把握する必要があります。一方、ランドマーク解析では、$t_L$時点での状態が分かれば解析できます。そのため、後ろ向き研究などで状態が変化した正確な日付を取得できない場合には、ランドマーク解析が現実的な選択肢になることがあります。

比例ハザード性が成り立たない場合にも、ランドマーク解析は扱いやすいことがあります。$t_L$以降の限られた期間を対象として解析するため、その期間内では比例ハザード性の仮定が妥当になる場合があるからです。

時点を進めながら予測を更新する

ランドマークを1つの時点に固定せず、複数の時点で繰り返し行う方法もあります。たとえば、6か月、12か月、18か月と$t_L$を進め、それぞれの時点から「その後5年間の生存率」を推定します。

ここで得られるのは、いわば動的な予測です。診断時点での予測は基本的に一度きりですが、この方法では、患者の経過に応じて予後の見通しを更新できます。たとえば、「診断から2年が経過し、その時点まで再発していない患者が、そこからさらに5年間生存する確率」といった、条件付きの予測が可能になります。

実装方法の一つとして、各ランドマーク時点のデータを積み重ね、1つのモデルで解析する方法があります。ランドマーク時点を共変量としてモデルに含め、効果が時点によって変化することを許容します。時点ごとに完全に別のモデルを当てるよりも、情報を共有できるため、推定が安定しやすくなります。

このような動的予測は結合モデルでも行うことができます。結合モデルが検査値などの縦断的な測定値の履歴全体を利用するのに対し、ランドマーク解析では基本的に$t_L$時点までに得られた情報を使って、その後の予後を予測します。そのため、ランドマーク解析は計算や実装が比較的容易である一方、測定値の履歴を十分に活用できない分、予測精度では結合モデルに及ばないことが多い、という関係になります。

群分けの基準に治療後の情報を使わない

奏効の有無で患者を分けて比較しても、不死時間を除いただけでは因果的な解釈はできません。奏効は治療後に観測される中間変数であり、患者がもともと持っている予後の良さも反映しているからです。

たとえば、腫瘍が小さく全身状態のよい患者ほど治療に奏効しやすく、同時に予後も良いとします。この場合、奏効そのものに延命効果がなくても、奏効例の生存成績は非奏効例より良くなります。ランドマーク解析は、このような交絡を解決する方法ではありません。ランドマーク解析によって主に対処できるのは、不死時間バイアスです。

したがって、ランドマーク解析の結果を「奏効すれば予後が改善する」と解釈するのは適切ではありません。そこから言えるのは、「6か月時点で奏効している患者は、奏効していない患者より、その後の予後がよい」という予後の記述までです。

治療効果を論じたいのであれば、比較する群は無作為化された治療割付によって定義するか、少なくとも治療開始時点で測定されている変数に基づいて定義する必要があります。治療後に生じる中間変数で群を分けた時点で、それは治療効果の推定ではなく、予後因子としての奏効の関連を記述する解析になります。

試験の副次解析でよく使われる

ランドマーク解析が登場する典型的な場面が、無作為化試験の副次解析です。治療の割付そのものではなく、治療中に観測された何らかの状態によって患者を分けて、その後の予後を比較したくなる状況です。

たとえば、治療を一定期間続けられた患者、有害事象が出なかった患者、バイオマーカーが低下した患者などです。いずれも治療開始後に決まる特徴なので、登録時点からこれらの状態で群分けすると、不死時間バイアスが生じます。

また、このような解析では、無作為化の利点も失われます。$t_L$時点での状態によって分けた2群は、無作為化された2群ではありません。そのため背景因子の調整が必要になりますし、それでも測定されていない交絡が残る可能性があります。

副次解析として報告する場合には、探索的な解析であることを明記します。主要解析と同じ強さの因果的な主張はできません。仮説を作るための材料として位置づけ、次の試験で検証する対象とするのが適切でしょう。

報告の仕方

まず、ランドマーク時点と、その選択理由を明記します。臨床的な根拠に基づく時点なのか、あらかじめ規定された評価時点なのかを示します。データを見た後に結果のよい時点を選んだのではないことも重要です。

次に、解析から除外された患者数を示します。$t_L$より前に何例がイベントを起こし、何例が打ち切られたのかを明記します。図3のように、ランドマーク時点までに除外される患者数は、結果を適用できる対象集団を決めます。除外された患者の背景も示しておくと、読者が解析結果の解釈を判断しやすくなります。

また、時間の原点が$t_L$であることを明示します。「6か月時点からの3年生存率」のように記載すれば、登録時点からの生存率との混同を避けられます。

複数の$t_L$で解析した結果は、補足資料などに示すのも有用です。1つの時点だけを報告すると、その時点が結果を見た後に選ばれたのではないかという疑念が生じる可能性があるためです。

次に確かめること

不死時間バイアスの構造そのものについては時変共変量で扱いました。ランドマーク解析は、その代替となる解析方法として位置づけられます。

検査値の履歴を使った動的予測については結合モデル、状態の変化を遷移として記述する方法についてはマルチステートモデルで扱っています。予測モデルの検証については予測モデルの検証で説明した考え方がそのまま適用できます。

ランドマーク解析と時変共変量のどちらを主解析にするか、そして基準時点をどこに置くかは、臨床的な評価時点とデータの取得可能性を踏まえて決める必要があります。Dr.データサイエンスでは、こうした解析設計についてのご相談を承っています。

参考文献

Anderson JR, Cain KC, Gelber RD. Analysis of survival by tumor response. Journal of Clinical Oncology. 1983;1(11):710-719.

Dafni U. Landmark analysis at the 25-year landmark point. Circulation: Cardiovascular Quality and Outcomes. 2011;4(3):363-371.

van Houwelingen HC. Dynamic prediction by landmarking in event history analysis. Scandinavian Journal of Statistics. 2007;34(1):70-85.

Morgan CJ. Landmark analysis: a primer. Journal of Nuclear Cardiology. 2019;26(2):391-393.

Putter H, van Houwelingen HC. Understanding landmarking and its relation to classical multistate models. JCO Clinical Cancer Informatics. 2017;1:1-11.

Popular Articles