t-test, ANOVA, Mann-Whitney 무엇을 써야 할까
통계 검정은 네 가지 질문으로 거의 정해집니다. 그룹이 몇 개인가? 짝지어진 데이터인가? 값이 정규분포에 가까운가? 대조군과만 비교하는가, 모든 쌍을 비교하는가? 이 글은 그 순서대로 고르는 법을 정리합니다.
1. 한 장으로 보는 선택표
| 상황 | 정규분포에 가까움 | 정규분포가 아님 |
|---|---|---|
| 2그룹, 서로 다른 샘플 | Welch t-test (추천) | Mann-Whitney U |
| 2그룹, 같은 대상 전·후 | paired t-test | Wilcoxon 부호순위 |
| 3그룹 이상, 대조군과만 비교 | ANOVA + Dunnett | Kruskal-Wallis + Dunn |
| 3그룹 이상, 모든 쌍 비교 | ANOVA + Tukey | Kruskal-Wallis + Dunn |
| 3그룹 이상, 분산이 크게 다름 | Welch ANOVA + Games-Howell | Kruskal-Wallis + Dunn |
세 그룹 이상인데 t-test를 여러 번 하면 비교 횟수만큼 우연한 "유의"가 늘어납니다. 그래서 ANOVA와 사후검정(Tukey·Dunnett)을 씁니다.
2. 왜 Welch t-test를 기본으로 쓰나
보통의 Student t-test는 두 그룹의 퍼짐(분산)이 같다고 가정합니다. 처리군은 대조군보다 퍼짐이 커지는 경우가 많아 이 가정이 자주 깨집니다. Welch t-test는 분산이 달라도 정확하고, 분산이 같을 때는 Student와 결과가 거의 같아서 기본값으로 권장됩니다.
3. n = 3일 때 주의할 점
- 정규성 검사를 믿기 어렵습니다. 값이 3개면 Shapiro-Wilk가 거의 항상 "정규"라고 답합니다. 보통은 모수 검정(t-test·ANOVA)을 쓰고, 값이 한쪽으로 치우친 종류(배수 변화, 농도)라면 log로 바꿔 검정합니다.
- 비모수 검정은 n = 3에서 유의성을 찾을 수 없습니다. 3개 대 3개 Mann-Whitney의 가장 작은 p값은 0.1입니다. 두 그룹이 완전히 나뉘어도 p < 0.05가 나올 수 없습니다.
- 가능하면 biological replicate를 늘리는 것이 어떤 통계 기법보다 효과적입니다.
4. Tukey와 Dunnett 중 무엇을?
Dunnett은 처리군 각각을 대조군 하나와만 비교합니다. 비교 횟수가 적어 같은 데이터에서도 검출력이 더 높습니다. 약물 농도별 처리처럼 "대조군 대비 효과"가 궁금할 때 씁니다. Tukey는 모든 쌍을 비교합니다. 처리군끼리의 차이(예: 약물 A와 B 중 어느 쪽이 센가)도 알고 싶을 때 씁니다.
5. 자주 하는 실수
- technical replicate를 n으로 세기: 같은 샘플을 여러 웰에 잰 것은 평균 내서 하나로 셉니다. (반복 실험과 통계)
- SEM 막대만 보고 판단: SEM 막대가 겹치지 않아도 유의하지 않을 수 있고, 겹쳐도 유의할 수 있습니다. 판단은 검정 결과로 합니다.
- p > 0.05를 "차이 없음"으로 쓰기: "이 실험으로는 차이를 확인하지 못했다"가 정확한 표현입니다.
- 결과를 보고 검정을 바꾸기: 검정 방법은 실험 설계에 따라 미리 정합니다.
값을 붙여넣고 두 가지 질문에만 답하면 알맞은 검정을 골라 이유와 함께 설명하고, 별표가 붙은 그래프까지 만듭니다.
그룹 비교 통계 열기 →