1. `기존 통계학`과 `베이즈 통계학` 차이점
ㅇ 기존 통계학 : 모집단을 변하지 않은 대상으로 봄
- 모집단에 대해 미리 규정시킨 확률분포 또는 고정된 모수를 출발점으로 삼음
ㅇ 베이즈 통계학 : 모집단을 미리 확정짓지 않음
- 모수를 확률변수 처럼 취급하고,
- 사전 정보(경험,주관적 판단)로부터 새로이 출발점을 삼음
. 즉, 매 표본 마다 나온 데이터를 다시 출발점으로 삼아가며,
. 정보가 증가됨에 따라, 확률이 수정/정제됨
2. 베이즈 추정의 과정 (Bayesian Inference)
ㅇ 모델화 → 사전확률 설정 → 우도 산출 → 데이터 관측 → 베이즈 정리 적용 → 사후확률 계산
- 먼저, 가능한 가설/원인과 관측되는 데이터 간의 관계를 모델화함
- 각 가설에 대한 사전확률(Prior)을 설정하고,
- 각 가설에서 모델로부터 현재와 같은 데이터가 관측될 우도(Likelihood)를 구한 후,
- 실제 데이터를 관측하고,
- 베이즈 정리를 이용하여, 각 가설의 사후확률(Posterior)을 계산함
- 이후 새로운 데이터가 들어올 때 마다, 사후확률을 새로운 사전확률로 사용하여,
- 베이즈 갱신(Updating)을 반복할 수 있음
※ [참고용어]
- 모델화 : 가설/원인과 관측 데이터 간의 확률적 관계를 모형화
. (사전지식 + 가설설정 + 관측모델 설정)
- 사전 확률 : 데이터 관측 전, 각 가설이 참일 것으로 보는 확률
- 우도 : 특정 가설에서 현재와 같은 데이터가 관측될 가능성 (가설 평가 관점의 조건부확률)
- 베이즈 정리 : 사전확률, 우도 등을 이용하여 사후확률을 구하는 관계식
- 사후 확률 : 관측 데이터를 반영하여 갱신된 각 가설의 확률
- 베이즈 갱신 : 새로운 관측 데이터가 들어올 때 마다 사후확률을 재계산하는 과정
3. 베이즈 갱신 (Bayesian Updating)
ㅇ 앞의 정보를 이용하여 다음 확률 계산을 위한 사전 확률에 활용하게 됨
- 추가된 정보로부터 사전 확률를 새롭게 수정/정제하여 사후 수정 확률을 얻어냄
4. 베이즈 통계의 의의
ㅇ 결과를 관측하고서 원인을 추론(추정)할 수 있게 함
ㅇ 즉, 확률의 수정/정제 과정이 설명됨
- 새로운 경험과 새로운 정보가 새로운 조건을 가져다주어,
- 정보가 증가함에 따라,
- 확률이 수정/정제되는 과정이 설명됨
ㅇ 강점
- 데이터 해석이 유연하고 자연스러움
- 데이터 수가 적어도 추측가능하고, 데이터 수가 많아질수록 정확해짐
- 데이터에 실시간적으로 반응하여(반복 이용), 추정의 자동화가 가능함
ㅇ 단점
- 분석자 재량이 크고, 재현성이 낮음