| 환자 | Follow-up | MI |
| A | 1년 | 발생 |
| B | 8년 | 없음 |
| C | 9년 | 발생 |
위 표에서 중요한 것.
1. Event 발생 여부 (세 번째 열)
2. 언제 event가 발생했는가 (두 번째 열)
Logistic regression에서는 두 번째 열 정보를 제외한다.
따라서, A환자와 C환자 모두 동일하게 MI - YES 정보를 가져가지만, 1년 후 발생, 9년 후 발생이라는 중요한 정보를 사용하지 않는다.
Survival analysis의 핵심 개념 3가지
1. Survival Probability = S(t)
의미: t 시점까지 event 없이 살아 있을 확률
| 시간 | Survival |
| 1년 | 0.98 |
| 5년 | 0.90 |
| 10년 | 0.75 |
2. Hazard(t)
의미: 지금 이 순간 event가 발생할 위험 (= event 발생 속도)
3. Hazard Ratio (HR)
의미: 두 그룹의 event 발생 속도 비율
예시
Smoking HR = 2
-> 흡연자는 event가 2배 빠르게 발생. 흡연자가 비흡연자에 비해 2배 발생한다는 의미가 아니다.
Cox model 의 핵심 질문: 어떤 변수들이 hazard를 증가시키는가?
예를 들어 age, smoking, protein level의 변수들이 있을 때, cox 모델은 이 변수들이 event 발생 속도를 얼마나 바꾸는지 모델링한다.
Cox model
$$ hazard(t)=baseline hazard(t)×exp(βX) $$
이 수식을 분해해서 살펴보자.
1. baseline hazard(t)
의미: 아무 변수도 없는 기본 위험. 예를 들어 평균환자, 또는 reference group의 위험.
중요한 점은 baseline hazard가 시간에 따라 변한다는 것이다.
| 시간 | baseline hazard |
| 1년 | 낮음 |
| 5년 | 조금 높음 |
| 10년 | 더 높음 |
예를 들어 심장관련질환은 시간이 지날수록 risk가 증가한다.
2. exp( βX)
의미: 환자의 risk multiplier
X = 변수 (e.g. age, smoking, protein)
β = 각 변수의 효과
예를 들어, β_smoking = 0.69 라면, exp(0.69) = 2.
따라서 hazard ratio = 2 가 된다.
3. 예시로 살펴보는 전체 hazard
hazard(t)=baseline hazard(t)×exp(βX)
위 수식을 예시로 살펴보자.
baseline hazard = 0.01, exp(βX) = 3 이면, hazard = 0.01 × 3 = 0.03
baseline hazard는 평균적인(reference) 환자의 순간 위험이므로 reference의 위험은 0.01,
어떤 환자의 exp(βX) = 3 이면 total hazard = 0.03이므로, 이 환자의 event 발생 속도는 평균환자보다 3배 높다고 할 수 있다.
4. Hazard Ratio
HR = hazard_interest / hazard_reference
위 예시에서 Hazard Ratio는 0.03/0.01 이므로 3이 된다.
'STATISTICS' 카테고리의 다른 글
| 통계: Repeatability vs Reproducibility (0) | 2024.04.12 |
|---|---|
| 통계 : 모수적 검정 (parametric test) vs 비모수 검정 (nonparametric test) (3) | 2024.03.12 |
| Statistics - 랜덤효과, 고정효과, 혼합모형을 쉽게 이해해보자 (1) (0) | 2023.08.13 |
| 다중비교 (Multiple comparisons test) [2] (0) | 2023.08.10 |
| Misunderstanding of ANCOVA (1) (0) | 2023.03.12 |


