比例ハザード性が崩れているデータで、効果をどう報告するかという場面があります。Schoenfeld残差の検定が有意になり、ハザード比を1つ出しても、それがどの時期の話なのか説明できない。かといって生存曲線を見せるだけでは、効果の大きさを1つの数字で書けません。
この状況で使えるのが制限付き平均生存時間です。時点$\tau$までの生存曲線の下の面積で、「$\tau$年間のうち平均何年生きたか」と読めます。比例ハザード性を仮定しないので、曲線がどんな形でも計算できます。
ただ、ハザード比の上位互換ではありません。$\tau$の選び方で値が変わりますし、検定としてはログランク検定より弱いこともあります。ここでは何が得られて何が得られないのかを、実データで確認します。
曲線の下の面積を測る
定義は積分1本です。
$$\mathrm{RMST}(\tau) = \int_0^{\tau} S(t)\,dt \tag{1}$$
式(1)は、生存曲線を$\tau$で切って、その下の面積を求めたものです。全員が$\tau$まで生存すれば面積は$\tau$になり、全員が直後に亡くなれば0に近づきます。単位は時間なので、日や月や年で報告できます。
平均生存期間$\mathbb{E}[T] = \int_0^{\infty} S(t)dt$との違いは、上限が有限なことだけです。生存関数とハザード関数で見たとおり、上限が無限大だと追跡期間の外を仮定しないと計算できません。$\tau$で切れば、観測された範囲だけで済みます。
veteranデータのKarnofsky指標で計算します。この変数は比例ハザード性が明確に崩れており、cox.zphの検定はp=0.0003でした。
library(survival)
veteran$kg <- ifelse(veteran$karno >= 70, "high", "low")
fit <- survfit(Surv(time, status) ~ kg, data = veteran)
print(fit, rmean = 180)
#> records events rmean* se(rmean) median
#> kg=high 58 52 123.32 7.24 144
#> kg=low 79 76 63.06 6.91 21
#> * restricted mean with upper limit = 180

群間差は標準誤差から区間も出せます。2群の分散を足して平方根をとると10.0日なので、差は-60.3日(95% CI -79.9から-40.6)となります。
同じデータのハザード比は2.25(95% CI 1.57-3.24)でした。2.25という比と、60日という時間。後者のほうが患者や共著者への説明には使いやすいと思います。「半年のうち2か月ぶん短い」と言えるからです。
区切りをどこに置くかで値が変わる
式(1)の$\tau$は解析者が決めます。ここが最大の注意点です。
for (tau in c(90, 180, 365)) {
s <- summary(fit, rmean = tau)$table
cat(tau, round(s[2, "rmean"] - s[1, "rmean"], 1), "\n")
}
#> 90 -33.4
#> 180 -60.3
#> 365 -84.5

90日で見れば1か月ぶん、1年で見れば3か月ぶんの差になります。どちらも同じデータから出た正しい値です。
そのため、$\tau$は解析計画に書いておく必要があります。結果を見てから$\tau$を動かすと、都合のよい値を選べてしまいます。決め方としては、臨床的に意味のある時点(がん領域なら3年や5年生存率が語られる時点)を使うか、両群のリスク集合が十分に残っている最大の時点を使うか。私なら前者を第一候補にして、後者を感度分析に回します。
もうひとつ、$\tau$は最も短く追跡が終わった群の最終観測時点を超えられません。片方の群の追跡が2年で終わっているのに$\tau$を3年に置くと、その先はKaplan-Meier曲線が水平に伸びているだけの領域を積分することになります。
検出力ではログランク検定に勝たない
比例ハザード性が崩れているならRMSTのほうが検出力も高い、と考えたくなります。実際にはそうとは限りません。
曲線が交差する状況と、効果が遅れて現れる状況で、ログランク検定とRMST差の検定を400回ずつ比べました。以下は説明のための架空データです。

この結果は、RMSTを勧めない理由にはなりません。RMSTの価値は検出力ではなく、非比例ハザードのもとでも意味の分かる数字が出ることにあります。有意かどうかを判定するだけならログランク検定で足り、効果の大きさを日数で語りたいときにRMSTを併記する。この使い分けが実務的でしょう。
逆に言えば、RMSTを主要な検定に据えるなら、$\tau$の設定次第で検出力が落ちることを症例数設計の段階で織り込む必要があります。図3の遅延効果のケースで$\tau$を短く取れば、検出力はさらに下がります。
比で書くか差で書くか
RMSTには比の形もあります。
$$\frac{\mathrm{RMST}_1(\tau)}{\mathrm{RMST}_0(\tau)} \tag{2}$$
式(2)は無次元なので、$\tau$の単位に依存しません。veteranの例なら123.3を63.1で割って1.96、つまりKarnofsky高値群は1.96倍の時間を生存した、となります。
差と比のどちらを主要な指標にするかは、読者が何を知りたいかで決まります。個々の患者に説明するなら差のほうが具体的です。60日長い、と言えます。集団間の比較や他研究との突き合わせなら比のほうが揃えやすい。両方書いても紙幅は取りません。
共変量調整も可能です。RMSTを応答変数とする回帰の枠組みがあり、疑似観測値を使う方法や、逆確率打ち切り重み付けを使う方法が提案されています。ただしCox回帰ほど手法が確立しておらず、実装も限られます。多変量調整が主目的なら、まずCox回帰で調整済みハザード比を出し、RMSTは群間の記述として併記する形が現実的です。
共変量で調整する
RMSTを応答変数とする回帰の方法がいくつか提案されています。実装が手に入りやすいのは疑似観測値を使う方法です。
全員を使って計算したRMSTと、1人ずつ抜いて計算したRMSTの差から、各患者に1つの値を割り当てます。この値を応答変数とする通常の回帰を当てると、共変量ごとのRMSTへの寄与が推定できます。打ち切りの情報が疑似観測値に織り込まれているので、回帰の側は打ち切りを扱う必要がありません。
もう一方は逆確率打ち切り重み付けを使う方法です。打ち切られなかった患者を、打ち切られる確率の逆数で重み付けし、観測されたRMSTを直接モデル化します。打ち切りが共変量に依存する場合はこちらのほうが素直です。
いずれも、得られる係数は「その共変量が1単位上がるとτまでの平均生存時間が何日変わるか」という差の形です。ハザード比のような比ではないので、患者説明にはさらに使いやすくなります。ただし実装はCox回帰ほど枯れておらず、標準誤差の計算方法も文献によって異なります。多変量調整が主目的なら、Cox回帰と併用する形が現実的でしょう。
非劣性試験での使い方
非劣性試験では、効果の差がある範囲を超えないことを示します。ハザード比で境界を設定すると、比例ハザード性が崩れた場合に境界の意味が曖昧になります。時期によってハザード比が違うのに、1つの境界と比べることになるためです。
RMSTの差なら、境界を時間の単位で置けます。「5年間の平均生存期間の差が2か月以内」という設定は、臨床的な意味が明確です。比例ハザード性が崩れていても、τまでの面積の差という定義は変わりません。
τを事前に決める必要は、非劣性試験ではむしろ利点になります。臨床的に意味のある観察期間と、許容できる差の大きさを、設計段階で並べて議論できるためです。規制当局との事前相談でも、この形なら論点が絞れます。
報告の仕方
RMSTを載せるなら、$\tau$を必ず明記します。「制限付き平均生存時間は12.3か月」とだけ書かれていても、何か月の区切りでの話か分かりません。$\tau$、両群のRMSTと標準誤差、群間差と信頼区間。この4点が最低限です。
$\tau$を選んだ根拠も1文で添えます。臨床的な時点なのか、追跡期間から決めたのか。事前に規定していたなら、その旨を書きます。
そして、ハザード比とRMSTのどちらを主要な効果指標にしたのかを明示します。両方を並べて有利なほうを結論に使うと、比例ハザード性の検定の結果を見てから指標を選んだことになり、第一種の過誤が保証されません。
比例ハザード性が崩れているときの選択肢は他にもあります。効果が時期によって変わることを明示的にモデル化する時変係数、群ごとに基準ハザードを分ける層別Coxモデル、そして重み付けを変えた検定です。それぞれ答えている問いが違うので、何を報告したいかを先に決めることになります。
次に確かめること
自分のデータで比例ハザード性が崩れているかどうかは比例ハザード仮定の検証で確かめます。崩れていた場合の重み付け検定の選び方はログランク検定、効果を時間比で表す方法はパラメトリック生存モデルで扱いました。
主要評価項目をRMSTに置くか、ハザード比のまま押し通して非比例性を考察で断るか。$\tau$をどこに設定するか。このあたりは試験の目的と追跡の設計を見ないと決まりません。Dr.データサイエンスでは、こうした効果指標の選択についてのご相談を承っています。
参考文献
Royston P, Parmar MKB. Restricted mean survival time: an alternative to the hazard ratio for the design and analysis of randomized trials with a time-to-event outcome. BMC Medical Research Methodology. 2013;13:152.
Uno H, Claggett B, Tian L, et al. Moving beyond the hazard ratio in quantifying the between-group difference in survival analysis. Journal of Clinical Oncology. 2014;32(22):2380-2385.
Tian L, Zhao L, Wei LJ. Predicting the restricted mean event time with the subject’s baseline covariates in survival analysis. Biostatistics. 2014;15(2):222-233.
A’Hern RP. Restricted mean survival time: an obligatory end point for time-to-event analysis in cancer trials? Journal of Clinical Oncology. 2016;34(28):3474-3476.
Klein JP, Moeschberger ML. Survival Analysis: Techniques for Censored and Truncated Data. 2nd ed. Springer; 2003.


