"p-value는 가설의 확률이 아니야. 귀무가설과 검정 모형을 가정했을 때, 선택한 통계량이 얼마나 극단적인지 나타내는 값이야."
정의
p-value는 귀무가설 H₀와 검정의 다른 가정들이 성립한다고 놓았을 때, 선택한 검정통계량이 관측값만큼 또는 그보다 더 극단적일 확률이야.
p-value = P(T가 관측값만큼 또는 더 극단적 | H₀와 모형 가정)
여기서 '더 극단적'의 방향은 단측검정인지 양측검정인지, 어떤 검정통계량을 골랐는지에 따라 달라져. p-value가 작을수록 자료와 H₀의 조합이 더 긴장된다고 볼 수 있지만, 모형 오지정이나 선택적 분석도 작은 값을 만들 수 있어.
말하지 않는 것
p=0.03은 H₀가 참일 확률이 3%라는 뜻이 아니야. H₀와 H₁의 사후확률을 구하려면 두 가설 아래의 자료모형, 사전확률, 비교 범위가 필요해. p-value 하나만으로는 그 계산을 할 수 없어.
p-value는 효과 크기, 실질적 중요성, 재현확률도 직접 알려주지 않아. 큰 표본의 작은 효과는 아주 작은 p-value를 낼 수 있고, 작은 표본의 중요한 효과는 큰 p-value를 낼 수 있어.
유의수준과 구분해
α는 데이터를 보기 전에 정하는 의사결정 기준이고, p-value는 데이터에서 계산해. p≤0.05라면 "귀무가설이 참일 때 이런 데이터가 5% 이하의 확률로 나온다"고 단순화하기보다, 선택한 통계량의 꼬리확률이 0.05 이하라고 말하는 편이 정확해.
유의성은 진실과 거짓의 경계선이 아니야. p=0.049와 p=0.051은 증거의 강도가 거의 같을 수 있어. 연속적인 값을 임계값 하나로 둘로 나누면 정보가 사라져.