Top 5 This Week

関連記事

【医療統計版】17. AFTモデル:効果を時間の比で表す

- 本サイト運営者のサービスの紹介 -

ハザード比0.72を患者に説明する場面があります。瞬間的な死亡の起きやすさが28%低い、という説明は正確ですが、伝わりにくい。「どのくらい長く生きられるのか」という質問には直接答えていません。

加速故障時間モデルは、効果を時間の比で表します。生存時間が何倍になるか。この指標なら「生存期間が1.4倍になる見込み」と言えます。

比例ハザード性が崩れているときの代替としても使われます。ただし、こちらは分布を指定する必要があり、その選択が推定値を動かします。

ハザードではなく時計を動かす

モデルは対数生存時間の線形回帰の形で書けます。

$$\log T = \boldsymbol{\beta}^\top \mathbf{x} + \sigma W \tag{1}$$

式(1)の$W$は誤差項で、その分布を何に置くかでモデルの名前が決まります。極値分布ならワイブル、正規分布なら対数正規、ロジスティック分布なら対数ロジスティックです。$\sigma$は尺度パラメータです。

生存関数で書くと、共変量の役割がはっきりします。

$$S(t \mid \mathbf{x}) = S_0\!\left(\frac{t}{\exp(\boldsymbol{\beta}^\top \mathbf{x})}\right) \tag{2}$$

式(2)では、共変量が時間軸そのものを伸縮させます。$\exp(\boldsymbol{\beta}^\top\mathbf{x})$が0.5なら、基準集団の2倍の速さで時間が進む。$\exp(\beta_k)$を時間比と呼び、これが報告する効果量になります。

2枚の生存曲線図。左の比例ハザードでは基準曲線をべき乗した形で曲線が下がり、右の加速故障時間では時間軸を縮めた形で曲線が下がる。
図1 同じ「悪化」でも下がり方が異なります。左は生存確率をべき乗し、右は横軸を縮めます。ハザード比が縦方向の変換なのに対し、時間比は横方向の変換です。

ワイブル分布は例外的に、両方の性質を同時に満たします。ワイブルAFTモデルは比例ハザードモデルでもあり、係数は$\beta_{\textrm{AFT}} = -\beta_{\textrm{PH}} \cdot \sigma$の関係で読み替えられます。他の分布ではこの対応がないので、時間比とハザード比は別物になります。

分布の選択で推定値が動く

veteranデータで、Karnofsky指標の効果を4つの分布で推定します。

library(survival)

veteran$kg <- factor(ifelse(veteran$karno >= 70, "high", "low"))
survreg(Surv(time, status) ~ kg + trt, data = veteran, dist = "weibull")
#> 分布            AIC     時間比(低値群)      尺度
#> exponential   1482.7   0.399 (0.278-0.572)   1.000
#> weibull       1482.4   0.387 (0.259-0.576)   1.103
#> lognormal     1474.7   0.278 (0.183-0.424)   1.222
#> loglogistic   1473.8   0.280 (0.187-0.420)   0.686
指数・ワイブル・対数ロジスティック・対数正規の4分布について、推定された時間比とAICを並べた図。分布によって時間比が0.28から0.40まで変わる。
図2 時間比は0.28から0.40まで動きます。AICは対数ロジスティックと対数正規が良く、ワイブルと指数は8ポイント劣ります。分布を変えると効果量が4割変わるということです。

ここがAFTモデルの弱点です。Cox比例ハザードモデルは基準ハザードの形を仮定しないので、この選択に悩む必要がありません。AFTでは分布の指定が必須で、その選択が推定値に直接効きます。

対処としては、AICで選んだうえで、他の分布でも推定して感度分析として並べる形になります。表の4行をそのまま補足資料に載せれば、読者は分布への依存度を判断できます。時間比が0.28でも0.40でも「大幅に短い」という結論は変わらないので、この例なら結論は頑健だと言えます。

当てはまりの確認も要ります。推定した曲線をKaplan-Meier曲線に重ねます。

veteranデータのKarnofsky指標別Kaplan-Meier曲線に、ワイブルAFTモデルの当てはめ曲線を重ねた図。前半で観測曲線とモデル曲線にズレがある。
図3 ワイブルの当てはまりは良くありません。高値群では最初の100日でモデルが低く出すぎ、その後は高く出すぎています。AICが対数ロジスティックに劣る理由がここに見えます。

この図を描かずにAICだけで選ぶのは勧めません。AICは相対的な比較しかしないので、候補が全て当てはまっていない場合でも、いちばんましなものを選んでしまいます。

いつAFTを選ぶか

AFTは効果を時間で語りたいときに向いています。時間比0.39は「生存期間がおよそ4割になる」と読めますし、中央値も直接出せます。この例では高値群140.5日、低値群54.3日でした。患者説明や医療経済の議論では、この形が使いやすいと思います。

比例ハザード性が崩れているときの代替にもなります。AFTは比例ハザードを前提としないので、Schoenfeld残差の検定に引っかかったデータでも当てられます。ただし代わりに「時間軸の伸縮が一定」という別の仮定が入るので、無条件に安全というわけではありません。図3のような当てはまりの確認が要ります。

追跡期間の外を推定したい場合も候補になります。分布を仮定しているぶん、観測範囲を超えた予測ができるためです。この論点はパラメトリック生存モデルで扱いました。外挿の妥当性は分布の指定に全面的に依存します。

逆に、AFTを選ばないほうがよい場面もあります。共変量が多く、そのなかに比例ハザード性を破るものが混じっているだけなら、層別Coxモデルのほうが手数が少なく済みます。分布の選択という別の判断を持ち込まずに済むためです。

区間打ち切りを扱える

実務で効いてくるAFTの利点として、区間打ち切りをそのまま尤度に載せられる点があります。Cox回帰の部分尤度はイベント時刻の順序で構成されるので、「3か月から6か月のあいだに起きた」という形の観測を素直には扱えません。

survreg関数はSurv関数のtype=”interval2″を受け取ります。定期検査でしか進行を捉えられない研究では、この形が実態に合います。3か月ごとのCT評価で進行が見つかったなら、実際の進行日は前回の検査日と今回のあいだのどこかであって、今回の検査日ではありません。

survreg(Surv(lower, upper, type = "interval2") ~ trt, data = d, dist = "weibull")

検査間隔を無視して発見日をイベント日として扱うと、生存期間が系統的に長めに推定されます。間隔が群間で違えばバイアスにもなります。区間打ち切りの詳しい扱いは別の記事で改めます。

残差で当てはまりを診断する

図3のように曲線を重ねる方法のほかに、残差による診断があります。AFTモデルでは標準化残差を使います。

$e_i = \frac{\log t_i – \boldsymbol{\beta}^\top \mathbf{x}_i}{\sigma} \tag{3}$

式(3)の$e_i$は、モデルが正しければ指定した分布に従うはずです。ワイブルなら極値分布、対数正規なら標準正規分布です。残差のKaplan-Meier曲線を描き、仮定した分布の生存関数と重ねれば、ズレが見えます。

打ち切りがある残差も扱えます。打ち切られた観測は残差も打ち切られたものとして、Kaplan-Meier推定量で曲線を作ります。この曲線が理論曲線から系統的に離れていれば、分布の指定が合っていません。

もうひとつ、共変量ごとに残差を並べる図も有用です。ある共変量の値が大きい範囲で残差が偏っていれば、その共変量の入れ方(線形かカテゴリか、対数変換すべきか)に問題があります。Coxモデルの診断で使うマルチンゲール残差と同じ発想です。

打ち切りが多いときの挙動

打ち切りが多いデータでは、分布の指定がより強く効きます。観測されたイベントが少ないほど、分布の裾の形を決めているのはデータではなく仮定になるためです。

イベント割合が2割を切るような研究では、AICで分布を選んでも差がほとんど出ないことがあります。どの分布も観測範囲では似た形になり、区別できるのは追跡の外側だからです。この状態で中央値や5年生存率を報告すると、数字の大半が仮定に由来することになります。

目安として、私はイベント割合が3割を下回るデータでAFTモデルの外挿を使うことを勧めません。観測範囲内のパーセンタイル点にとどめるか、分布を仮定しないCox回帰に戻します。

報告の仕方

時間比であることを明記します。「ハザード比0.39」と「時間比0.39」はまったく違う意味なので、表の見出しに何の比かを書きます。英語ならtime ratioかacceleration factorです。

指定した分布と、その選択理由も書きます。AICで選んだならその値、臨床的な根拠があるならそれを1文で。感度分析として他の分布の結果を補足資料に置くと、読者が判断できます。

尺度パラメータも載せます。ワイブルなら形状パラメータ(この例では0.907)が、ハザードが時間とともに増えるか減るかを示します。1未満なら減少、1より大きければ増加、1なら一定で指数分布に一致します。

中央値やパーセンタイル点の予測値を添えると、時間比だけより伝わります。survregのpredict関数にtype=”quantile”を渡せば計算できます。

読者の多くはハザード比に慣れています。AFTを主要な解析にするなら、Cox回帰の結果も並べておくと親切です。この例ではCoxのハザード比が2.31、AFTの時間比が0.39でした。向きが逆に見えますが、どちらも低値群の予後が悪いことを表しています。時間比は1未満が短命、ハザード比は1より大きいほうが短命なので、表に注記を1行入れると誤読を防げます。

次に確かめること

分布の当てはめそのものはパラメトリック生存モデルで扱いました。比例ハザード性の確認は比例ハザード仮定の検証、崩れているときの他の選択肢は層別CoxモデルRMSTにあります。

効果指標をハザード比・時間比・RMSTのどれで報告するか、分布の選択をどう正当化するか。このあたりは研究の目的と読者層を見ないと決まりません。Dr.データサイエンスでは、こうした解析方針のご相談を承っています。

参考文献

Wei LJ. The accelerated failure time model: a useful alternative to the Cox regression model in survival analysis. Statistics in Medicine. 1992;11(14-15):1871-1879.

Collett D. Modelling Survival Data in Medical Research. 3rd ed. Chapman and Hall/CRC; 2015.

Kalbfleisch JD, Prentice RL. The Statistical Analysis of Failure Time Data. 2nd ed. Wiley; 2002.

Swindell WR. Accelerated failure time models provide a useful statistical framework for aging research. Experimental Gerontology. 2009;44(3):190-200.

Klein JP, Moeschberger ML. Survival Analysis: Techniques for Censored and Truncated Data. 2nd ed. Springer; 2003.

Popular Articles