Volcano plot·Heatmap·PCA 해석법
RNA-seq 그래프는 두 가지 질문에 답합니다. "샘플들이 믿을 만한가?"(PCA·상관관계)와 "무엇이 얼마나 변했나?"(volcano·heatmap·Venn). 결과를 해석하기 전에 첫 번째 질문부터 확인하는 것이 순서입니다.
1. PCA — 샘플 품질부터
PCA는 수천 개 유전자의 발현 패턴을 2차원으로 요약합니다. 축 이름의 %는 그 축이 전체 변동의 몇 %를 설명하는지입니다.
- 같은 그룹 반복끼리 모이고, 그룹끼리는 떨어져야 정상입니다. PC1이 처리 여부로 갈리면 처리 효과가 가장 큰 변동이라는 뜻입니다.
- 혼자 동떨어진 샘플은 RNA 품질·라이브러리 문제일 수 있습니다. 상관관계에서도 낮게 나오면 제외를 검토합니다(이유를 기록).
- 그룹이 아니라 실험 날짜·배치대로 갈리면 배치 효과입니다. 통계 모델에 배치를 넣어 보정합니다.
2. 샘플 상관관계
샘플 간 Pearson r은 전체 발현 패턴이 얼마나 닮았는지 보여 줍니다. 같은 세포주·조직의 반복은 보통 r > 0.95로 매우 높고, 같은 그룹 반복끼리 가장 높아야 정상입니다. 한 샘플만 전체적으로 낮다면 PCA의 이상치와 같은 샘플인지 확인하세요.
3. Volcano plot
x축은 log2 fold change(변화 크기), y축은 −log10(p값)(신뢰도)입니다. 위로 갈수록 p값이 작습니다(−log10 2 = p 0.01, 3 = p 0.001).
- 오른쪽 위 = 크게, 확실히 증가 · 왼쪽 위 = 크게, 확실히 감소 · 가운데 아래 = 변화 없음
- 세로 점선 = fold change 기준, 가로 점선 = p값 기준. 두 기준을 모두 넘은 점이 DEG입니다.
- 위로 높지만 가운데에 있는 점은 변화는 작지만 매우 일관된 유전자입니다. 생물학적 의미는 배수 크기와 함께 판단합니다.
4. Heatmap (z-score)
heatmap은 유전자마다 z-score(그 유전자 평균에서 몇 표준편차 떨어졌나)로 색칠합니다. 그래서 빨강·파랑은 "그 유전자 안에서 상대적으로 높다·낮다"이지, 유전자끼리의 절대 발현량 비교가 아닙니다.
- 왼쪽 가지(dendrogram)는 패턴이 비슷한 유전자끼리 묶은 것입니다. 같이 오르내리는 유전자 묶음은 같은 경로에 속하는 경우가 많습니다.
- 샘플도 군집하면 같은 그룹끼리 묶이는지로 반복의 일관성을 다시 확인할 수 있습니다.
- 보통 p값 상위 50–100개 DEG로 그립니다. 너무 많으면 패턴이 흐려집니다.
5. Venn과 다음 단계
비교가 여러 개면(예: 약물 A·B 각각 대조군 대비) Venn diagram으로 공통 DEG와 특이 DEG를 나눕니다. 억제제가 되돌린 유전자는 "처리로 변했고, 억제제+처리에서는 변하지 않은" 영역에서 찾습니다.
DEG 목록이 나오면 기능 분석으로 넘어갑니다. 증가·감소 목록을 따로 DAVID·Enrichr·g:Profiler에 넣어 GO·KEGG 경로를 보고, 기준 없이 전체 유전자 순위를 쓰는 GSEA로 약한 변화가 모인 경로까지 확인합니다.
파일을 올리면 volcano·scatter·heatmap·PCA·상관관계·Venn을 바로 그리고, DAVID·GSEA 입력 파일과 PPT로 내보냅니다.
RNA-seq 도구 열기 →