자료실 · 튜토리얼 · 6분

Volcano plot 읽는 법

Volcano plot은 RNA-seq 차등 발현 분석에서 가장 흔히 쓰이는 그림이자, 가장 자주 잘못 읽히는 그림이기도 합니다. 무엇을 보고 무엇을 조심해야 하는지 정리했습니다.

Volcano plot이란

모든 유전자에 대한 차등 발현 검정 결과를 한 장에 요약한 산점도입니다. 점 하나가 유전자 하나입니다.

  • x축 — log₂ fold change: 두 조건 사이에서 발현이 얼마나 변했는지. 0은 변화 없음, 양수는 실험군에서 증가, 음수는 감소입니다.
  • y축 — −log₁₀ p-value: 그 변화가 실제일 가능성에 대한 근거의 강도. 위로 갈수록 p-value가 작습니다.

이름은 모양에서 왔습니다. 유의하지 않은 유전자들이 아래 가운데에 구름처럼 모이고, 유의한 유전자들이 양쪽 위로 분출하듯 솟아오릅니다.

왜 두 축 모두 로그 스케일인가

log₂ fold change에서 1은 2배, 2는 4배, −1은 절반을 뜻합니다. 증가와 감소가 0을 기준으로 대칭이 되죠. −log₁₀은 0.001, 0.000001 같은 아주 작은 p-value를 읽기 쉬운 높이로 바꿔, 가장 유의한 유전자가 위로 올라오게 합니다.

무엇을 “유의한 유전자”로 볼 것인가

두 개의 기준선이 구름을 후보 목록으로 바꿉니다.

  • 수직 두 선은 fold change 임계값입니다(보통 |log₂FC| ≥ 1, 즉 2배 변화). 두 선 사이의 유전자는 변화 폭이 작습니다.
  • 수평선은 유의성 임계값입니다(보통 보정 p < 0.05). 이 아래의 유전자는 통계적 근거가 약합니다.

좌상단(유의하게 감소)과 우상단(유의하게 증가)에 있는 유전자만 두 기준을 모두 통과합니다. 이들이 차등 발현 유전자(DEG)입니다.

p-value와 보정 p-value

가장 많이 건너뛰는 단계입니다. RNA-seq 실험은 수만 개의 유전자를 동시에 검정하므로, 우연만으로도 유의해 보이는 유전자가 나옵니다. 보정 p-value(FDR 또는 q-value, 보통 Benjamini–Hochberg 방법)는 이 다중 검정 문제를 보정합니다.

항상 원시 p-value가 아니라 보정 p-value로 임계값을 잡으세요. 잘 만든 volcano plot은 y축에 보정값을 씁니다.

피해야 할 네 가지 실수

유의하지 않은 큰 변화 쫓기

오른쪽 멀리 있지만 아래에 있는 유전자는 변화 폭은 크되 근거가 약합니다. 카운트가 낮아 추정이 불안정한 경우가 많습니다.

“유의한” 미세한 변화 믿기

반복 수가 충분하면 생물학적으로 무의미한 변화도 p-value 기준을 통과합니다. fold change 임계값도 함께 두세요.

원시 p-value로 판단하기

다중 검정 보정 없이는 후보 목록이 부풀려집니다.

방향 놓치기

왼쪽과 오른쪽은 바꿔 쓸 수 없습니다. 어느 조건이 기준(baseline)인지 확인해야 증가·감소가 의도한 의미가 됩니다.

실제로 읽는 순서

세 번에 나눠 보세요. 먼저 전체 모양 — 반응이 넓게 퍼졌는지 좁게 집중됐는지, 증가와 감소가 균형을 이루는지. 다음으로 양쪽 상단 모서리의 유전자들. 마지막으로 개별 유전자를 확인합니다.

Liragen Insights의 Volcano 리포트는 인터랙티브합니다. fold change와 보정 p 슬라이더를 움직이면 플롯과 유전자 목록, 그리고 해석문이 함께 다시 계산됩니다.

← 자료실로 돌아가기

직접 Volcano plot 만들어 보기 — 코드 없이

NCBI 등록번호를 입력하면 몇 분 안에 스스로 설명하는 인터랙티브 Volcano 리포트를 받아볼 수 있습니다.