BLAST 결과 읽는 법
BLAST는 내 서열과 비슷한 서열을 데이터베이스에서 찾아 줍니다. 결과 표의 숫자 네 개 — E-value, Percent identity, Query cover, Max score — 만 이해하면 대부분의 판단을 할 수 있습니다.
1. 프로그램 고르기
| 상황 | 프로그램 |
|---|---|
| 내 서열이 무엇인지 (거의 같은 서열 찾기, 시퀀싱 확인) | blastn → megablast (기본값, 빠름) |
| 다른 종의 비슷한 유전자 찾기 | blastn → dc-megablast 또는 blastn |
| primer처럼 짧은 서열 (≈ 30 nt 이하) | blastn (짧은 서열용으로 자동 조정) — primer 쌍은 Primer-BLAST가 더 알맞음 |
| 단백질 서열 | blastp · 번역해서 찾기는 blastx / tblastn |
2. 데이터베이스
- core_nt / nt: 가장 넓은 기본 선택. 무엇인지 모르는 서열에 씁니다.
- RefSeq RNA / genomic: 정리된 참조 서열만 — 결과가 깔끔합니다.
- 생물종을 알면 Organism 칸에 넣어 범위를 좁히면 빠르고 읽기 쉽습니다.
3. 결과 표의 숫자
| 숫자 | 뜻 | 판단 |
|---|---|---|
| E-value | 이만큼 비슷한 결과가 우연히 나올 것으로 기대되는 개수 | 작을수록 확실. 1e-50보다 작으면 사실상 같은 서열. 짧은 서열은 완전히 같아도 E-value가 커집니다 |
| Percent identity | 정렬된 부분에서 같은 염기의 비율 | 시퀀싱 확인은 99–100%, 같은 유전자의 다른 종은 80–95% |
| Query cover | 내 서열 중 정렬된 부분의 비율 | identity가 100%여도 cover가 30%면 일부만 같은 것 |
| Max / Total score | 정렬 점수 (길고 정확할수록 큼) | Total이 Max보다 크면 여러 조각으로 나뉘어 맞았다는 뜻 (예: exon들) |
판단은 identity와 cover를 함께 봅니다. "100% identity"라도 짧은 일부 구간일 수 있습니다.
4. 자주 쓰는 두 가지 활용
Sanger 시퀀싱 결과 확인
받은 서열의 앞뒤 20–50 nt는 품질이 낮으니 잘라 내고, "Align two or more sequences"(BLAST 2 sequences)에 내 설계 서열과 함께 넣어 비교합니다. 불일치 위치가 나오면 크로마토그램(.ab1)에서 그 자리의 피크가 깨끗한지 확인해 실제 돌연변이인지 판독 오류인지 판단합니다.
콜로니·PCR 산물이 무엇인지
megablast로 검색해 1위 결과의 identity·cover를 봅니다. 대장균·vector 서열이 먼저 나오면 오염이나 빈 vector를 의심합니다.
primer 도구의 "BLAST로 이 primer 검색" 버튼은 서열이 채워진 blastn 화면을, 클로닝 도우미는 역상보·번역·ORF 찾기로 서열 확인을 도와줍니다.
클로닝 도우미 열기 →