サインイン
Click here - to use the wp menu builder
サインイン
ようこそ!
あなたのアカウントにログイン
あなたのユーザー名
あなたのパスワード
パスワードを忘れましたか?
プライバシーポリシー
パスワードの復元
パスワードをリカバーする
あなたのEメール
検索
i DataScience
現代データサイエンスの基礎と実践
相関分析
回帰分析
一般化線形モデル(GLM)
生存時間解析
当サイトについて
利用規約
プライバシー・ポリシー
お問い合わせ
Linkedin
CrowdWorks
CrowdWorks
i DataScience
2026年 9月 6日 日曜日
当サイトについて
利用規約
プライバシー・ポリシー
お問い合わせ
i DataScience
中級者向けのデータサイエンス学習メディア
【統計学 & 機械学習】
Movies
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
TV Shows
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Music
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Celebrity
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Scandals
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Drama
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Lifestyle
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Health
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Technology
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Company
当サイトについて
利用規約
プライバシー・ポリシー
お問い合わせ
Instagram
Linkedin
X
現代データサイエンスの基礎と実践
第1章 統計学とデータ分析の基本原則
第2章 主要な確率分布とその実用的な意味
第3章 データの要約と探索
第4章 モデルの前提条件と妥当性検証
第5章 推測統計学(仮説の検証)
第6章 回帰分析とモデルの正則化
第7章 一般化線形モデル(GLM)
第8章 構造的・階層的モデリング
第9章 多変量解析と次元削減
第10章 生存時間解析
総括:現代データサイエンスにおける統計モデリングの体系と実践
2026年3月11日
10.4 パラメトリック生存時間モデル
2026年3月11日
10.3 比例ハザード性の検証と拡張
2026年3月10日
10.2 Cox比例ハザードモデル
2026年3月9日
10.1 生存時間分析の基礎(カプラン・マイヤー法)
2026年3月8日
相関分析
回帰分析
一般化線形モデル(GLM)
生存時間解析
検索
Movies
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
TV Shows
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Music
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Celebrity
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Scandals
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Drama
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Lifestyle
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Health
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Technology
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
2026年9月6日
0
追跡30か月で治癒割合を0.370と推定したデータが、120か月まで追うと0.265に落ち着きます。非治癒者の分布を替えると13ポイント動く点まで含めて、平坦部の読み方を解説します。
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
2026年9月6日
0
同じCoxモデルから、見かけ0.749、ブートストラップ補正0.703、外部データ0.631という3つの数字が出ます。較正勾配0.433と決定曲線まで含めて、検証の読み方を解説します。
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
2026年9月5日
0
主解析のハザード比0.682に対しE値は2.29ですが、信頼区間の上限では1.34まで下がります。補正式で参照モデルを再現しながら、偏りの向きとtipping pointの読み方を解説します。
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
2026年9月5日
0
多変量Cox回帰を組もうとして変数を並べると、最後に数人から数十人が消えることがあります。追跡時間とイベントは全員分そろっているのに検査値が欠け、解析対象者数が少し減るだけなら気にしなくてよい、と扱われがちです。しかし、そこで残った人が元の研究集団と同じとは限らず、欠測をどう扱ったかはハザード比と95%信頼区間の両方を動かします。 生存時間解析の欠測では、共変量だけを補完すればよいと考えるのも注意が必要です。イベントの有無と追跡時間が補完に使われなければ、予後と関連する情報を捨てたまま値を作ることになります。ここではsurvivalパッケージのpbcデータセットを使用して、完全ケース解析がどの仮定で成り立つか、多重代入で何を混ぜるか、そして推定値の差をどう報告するかを確かめます。また、Cox回帰用の補完モデルへイベントと追跡時間を入れる理由、完全ケースと多重代入の差を恣意的に選ばず報告する仕方も、同じ例に沿って扱います。 最初に欠けるのは値ではなく対象集団 欠測がある行を除く完全ケース解析は、最も手軽です。ただし、これは解析対象者を変える操作でもあります。たとえば胆汁酸塩の高い患者ほど検査を受けやすい、あるいは重症で早くイベントが起きた患者ほど来院時の検査値が残っていない、という状況なら、欠測のない人だけのCox回帰は元の登録集団をそのまま代表しません。 欠測機構は、観測値とも未観測値とも無関係なMCAR、観測されている情報で説明できるMAR、未観測値そのものにも依存するMNARに分けて考えます。そして、完全ケース解析が係数推定で比較的扱いやすいのは、欠測の起こり方がアウトカムと独立という強い条件が満たされる場面です。欠測割合が小さいことはこの条件の代わりにならず、Sterneらは、欠測割合だけを見て方法を決めるのではなく、なぜ値が欠けたかを研究の情報から考える必要があると整理しています。 私なら、欠測率の表を最初に作り、次に欠測あり・なしでイベント率と追跡時間の分布を比べます。差が見えたからMNARと結論づけるわけではありませんが、完全ケースだけで済ませる根拠が弱いことは分かります。情報的打ち切りで扱ったように、観測されなくなる仕組みを無視して同じ集団とみなすと、推定対象がいつの間にか変わります。 完全ケース解析が使える条件 完全ケース解析は検査項目の欠測がごく少なく、欠測の理由がイベントや予後と関係しないと説明でき、外した人数とイベント数を明記できるなら、主解析としても読みやすい方法です。ただし「欠測が5%未満なので完全ケースにした」という説明だけは勧めません。5%という数字から、欠測機構は分からないためです。 Cox回帰では、共変量が1つ欠けただけでその患者の追跡時間全体が尤度から外れます。イベントが114件ある284人で推定したハザード比と、イベントを保持した312人で推定したハザード比は、同じモデル式でも別の情報に基づく値です。特に候補共変量を多く入れる予後モデルでは、各変数の小さな欠測が重なり、完全ケース数が予想より大きく減ります。予測モデルの検証で説明した性能評価も、完全ケースだけに限定すれば、欠測を含む実際の対象集団への一般化可能性を別に考える必要があります。 一方で、アウトカムのイベント判定そのものが欠ける場合は話が異なります。共変量欠測の多重代入を、そのままイベント欠測に当てはめることは勧めません。イベント確認の手順、打ち切りの定義、そして未確認の理由を先に分けて考える必要があり、エンドポイントの定義と整合させます。 多重代入で推定値を一つに戻す 多重代入では、観測された年齢、検査値、イベント、追跡時間などから欠測値のもっともらしい候補を作り、補完済みデータセットを複数用意します。各データセットに同じCox回帰を当てはめ、係数を平均するだけでは足りません。補完ごとに推定値が動く不確実性も分散へ加えます。 $Q_m$は$m$番目の補完済みデータセットの係数、$bar{Q}$はその平均、$bar{U}$は各データセット内の分散の平均、$B$は補完同士の係数のばらつき、$T$は最終的な分散です。つまり、補完後の標準誤差は、通常のCox回帰の不確実性だけでなく、欠測値をどのように補ったかによる不確実性も含みます。 単一代入では、中央値を1回入れた後のデータを本物の観測値と同じように扱います。この方法は標準誤差を小さく見せやすいため、推定値が欲しいだけの探索的な確認を除き、最終報告には使いません。MICEのような連鎖方程式による多重代入は、連続値、二値、順序尺度が混在する研究データへ使いやすく、Whiteらが実務上の注意点をまとめています。 補完モデルに生存時間を入れる理由 予後と関係する共変量を補完するなら、イベント指標だけでなく追跡時間も補完モデルへ入れます。生存時間解析では、同じイベントなしでも30日で打ち切られた人と3,000日追跡された人は同じ情報量ではなく、したがってイベント指標だけを入れると、この違いを補完の予測に使えません。 Cox回帰の係数を主な関心とする場合、Nelson-Aalen累積ハザード推定量とイベント指標を補完モデルに含める方法がよく使われます。そして、追跡時間を生のまま入れるか、累積ハザードとして入れるかは、欠測変数の型や補完手法で変わります。注意点として、解析モデルに入る変数だけを補完するだけでは十分ではなく、欠測値をよく予測し、かつ欠測の起こり方と関係しそうな補助変数も加える方が、MARの仮定を置く際の説明が具体的になります。 ただし、補完モデルへ大量の変数を機械的に入れればよいわけでもありません。観測数が少なく欠測が多い変数や、明らかに不安定な予測式を混ぜると、補完値そのものが不自然になります。連続変数なら補完値の範囲、二値変数なら割合、補完前後の分布を確認します。Coxモデルの診断と変数選択と同じく、モデルを一度当てはめて数字だけを受け取る進め方には無理があります。 pbcデータで284人と312人を比べる survivalパッケージのpbcデータセットから治療群が記録された312人を取り出し、死亡をイベントとして、対数変換したビリルビン、アルブミン、コレステロールをCox回帰に入れます。コレステロールには28人の欠測があり、3変数が全てそろう完全ケースは284人、死亡は114件でした。そして、予測平均マッチングでコレステロールを20回補完し、各回のモデルをRubinの規則で統合します。 set.seed(42) library(survival) library(mice) data(pbc, package = "survival") analysis_data <- subset(pbc, !is.na(trt)) analysis_data$death <- as.integer(analysis_data$status...
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
2026年9月5日
0
予後の悪い患者ほど早く脱落すると、20か月生存率が真値0.427に対して0.511と推定されます。脱落率が群間で違えばハザード比も0.738から0.886へ動きます。仮定の破れ方と対処を解説します。
Company
当サイトについて
利用規約
プライバシー・ポリシー
お問い合わせ
Instagram
Linkedin
X
現代データサイエンスの基礎と実践
第1章 統計学とデータ分析の基本原則
第2章 主要な確率分布とその実用的な意味
第3章 データの要約と探索
第4章 モデルの前提条件と妥当性検証
第5章 推測統計学(仮説の検証)
第6章 回帰分析とモデルの正則化
第7章 一般化線形モデル(GLM)
第8章 構造的・階層的モデリング
第9章 多変量解析と次元削減
第10章 生存時間解析
総括:現代データサイエンスにおける統計モデリングの体系と実践
2026年3月11日
10.4 パラメトリック生存時間モデル
2026年3月11日
10.3 比例ハザード性の検証と拡張
2026年3月10日
10.2 Cox比例ハザードモデル
2026年3月9日
10.1 生存時間分析の基礎(カプラン・マイヤー法)
2026年3月8日
相関分析
回帰分析
一般化線形モデル(GLM)
生存時間解析
検索
404 エラー
お探しのページは見つかりませんでした。
トップページに戻る
【医療統計版】32. 治癒率モデル:生存曲線の平坦部をどこまで信じるか
生存時間解析
KenichiroSuzuki
-
【医療統計版】31. 予測モデルの検証:C統計量0.75は本当に0.75か
生存時間解析
KenichiroSuzuki
-
【医療統計版】30. 生存時間解析における感度分析:E値とtipping pointは別の問いに答えている
生存時間解析
KenichiroSuzuki
-
【医療統計版】29. 生存時間解析における欠測データ(完全ケースと多重代入)
生存時間解析
KenichiroSuzuki
-
【医療統計版】28. 情報的打ち切り:脱落した患者は他の患者と同じだったか
生存時間解析
KenichiroSuzuki
-
【医療統計版】27. 動的治療戦略:始める・始めないの二択では最良の方針を見落とす
生存時間解析
KenichiroSuzuki
-
【医療統計版】26. ターゲット試験エミュレーション:time zeroのズレが効果を2倍に見せる
生存時間解析
KenichiroSuzuki
-
【医療統計版】23. 生存時間解析における因果推論:回帰調整とIPTWは違う量を推定する
生存時間解析
KenichiroSuzuki
-
【医療統計版】25. 周辺構造モデル:検査値で調整すると治療効果が半分になる
生存時間解析
KenichiroSuzuki
-
【医療統計版】24. 傾向スコアマッチング:誰が解析から消えたのか
生存時間解析
KenichiroSuzuki
-
【医療統計版】21. マルチステートモデル:中間事象を含む経過を記述する
生存時間解析
KenichiroSuzuki
-
【医療統計版】22. ランドマーク解析:奏効例と非奏効例を比べてよいか
生存時間解析
KenichiroSuzuki
-