RNA-seq DEG 분석 결과 읽는 법: fold change·p-value·FDR

약 8분 분량 · 업데이트 2026-09-26

DEG(differentially expressed gene)는 두 조건 사이에서 발현량이 충분히 크게, 그리고 우연이 아니라고 볼 만큼 달라진 유전자입니다. 그래서 기준은 항상 두 개입니다. "얼마나 변했나(fold change)"와 "믿을 만한가(p-value·FDR)"입니다.

1. 결과 표의 열 읽기

분석 업체 보고서든 DESeq2·edgeR 결과든 핵심 열은 거의 같습니다.

열 이름 (예)뜻
log2FoldChange · logFC처리군 ÷ 대조군 발현 비율의 log2. 양수 = 증가, 음수 = 감소
Fold change비율 그 자체(2 = 2배). 보고서에 따라 감소를 0.5로 쓰기도, −2로 쓰기도 합니다
pvalue · PValue유전자 하나만 놓고 본 검정의 p값
padj · FDR · q-value여러 유전자를 동시에 검정한 것을 보정한 값
baseMean · logCPM · AveExpr전체 평균 발현량. 낮을수록 추정이 불안정합니다
Normalized data · CPM · TPM샘플 간 시퀀싱 깊이를 맞춘 발현값

먼저 비교 방향을 확인하세요. "B/A"는 A 대비 B입니다. 대조군과 처리군이 뒤바뀌면 증가·감소가 통째로 반대가 됩니다.

2. fold change와 log2FC

변화Fold changelog2FC
4배 증가42
2배 증가21
변화 없음10
절반으로 감소0.5 (또는 −2)−1
1/4로 감소0.25 (또는 −4)−2

log2로 바꾸면 증가와 감소가 0을 중심으로 대칭이 되어 그래프와 평균 계산이 정확해집니다. 가장 흔한 기준은 2배(|log2FC| ≥ 1)이고, 변화가 작은 조직·약한 처리에서는 1.5배(0.585)를 쓰기도 합니다.

3. p-value와 FDR — 무엇을 쓸까

유전자 20,000개를 p < 0.05로 검정하면, 실제로 아무 변화가 없어도 약 1,000개(5%)가 우연히 유의하게 나옵니다. FDR(Benjamini–Hochberg)은 "선별한 유전자 중 거짓 양성의 비율"을 기준 이하로 묶도록 p값을 보정한 값입니다.

기준언제
FDR (padj) < 0.05논문·발표의 기본. DESeq2·edgeR를 쓴 경우 권장
p-value < 0.05분석 업체 보고서의 흔한 기준. 후보를 넓게 보는 탐색 단계, 반복 수가 적어 FDR로는 거의 안 남을 때

어느 쪽을 쓰든 Methods에 기준을 정확히 적는 것이 가장 중요합니다. p-value 기준을 썼다면 결과를 "후보"로 표현하고 qPCR 등으로 검증하는 것이 안전합니다.

다중 검정의 우연 양성변화 없음 (380개)우연히 p &lt; 0.05 (20개 = 5%)
실제로 아무 변화가 없는 유전자 400개를 p < 0.05로 검정했을 때의 예시입니다. 빨간 칸 약 20개(5%)가 우연히 "유의"하게 나옵니다. 유전자 20,000개라면 약 1,000개입니다. FDR은 이런 거짓 양성의 비율을 제한합니다.

4. 최소 발현량과 반복 수

5. 자주 하는 실수

보고서 엑셀이나 DESeq2 결과표를 올리면 추천 기준으로 DEG를 바로 고르고, 기준을 바꿀 때마다 개수와 그래프가 즉시 바뀝니다.

RNA-seq 도구 열기 →