模組 2 · Essential biology for cancer genomics

癌症基因體分析的基礎生物學

區分 allele、variant、genotype 與 haplotype,並說明 germline、somatic、clone 與 subclone 的關係。

約 45 分鐘建議先修:簡化模型

本模組學習目標

  • 精確區分 locus、allele、variant、genotype、haplotype 這幾個常被混用的詞
  • 說明 germline 與 somatic 變異在來源、分布與可遺傳性上的差別
  • 解釋 heterozygous 位點如何提供 phasing 資訊,以及 homozygous 位點的限制
  • 說明 subclone 與治療反應之間的可能關係
  • 定義 SNV 與 LOH,並說明它們在腫瘤基因體分析中的角色

為什麼重要

M1 先以 HP1/HP2、founder clone 與 subclone 作為圖示標籤,以呈現整體資料流。 本模組將進一步區分這些標籤,並建立較精確的生物學資料模型。

這些術語形式相近,但所指的資料層級不同。常見混淆是將 variant 與 allele、 或 genotype 與 haplotype 混用,因而難以精確解讀文獻與資料格式。

自學閱讀時,可先將下列五個詞對應至資料結構的不同層級: 地址、該地址的一種值、與參考不同的事件、單一地址的兩份值、跨多個地址的一整串值。 先掌握概念層級,再對應英文術語。

概念與互動

五個容易混用的詞

指的是例子
一個位置chr1:162,404,043
該位置上其中一種序列這個 locus 可以是 AG,各是一個 allele
variant / variant 是相對參考序列的差異;SNV 是單一鹼基替換的 variant參考為 A、樣本為 G → 一個 SNV
該位置上兩份 allele 的組合0/1:一份跟參考一樣、一份不一樣
同一條染色體拷貝上具有一致相位的一組 allelesHP1 = A…C…G,HP2 = T…A…C

上表以正常二倍體常染色體為模型,因此同一個 locus 通常有兩份 allele。 這種具有兩份拷貝的狀態稱為 ;性染色體與腫瘤拷貝數異常將於後續模組另行處理。

locus、allele、genotype、haplotype 四個詞在同一張圖上的位置 同一段染色體上標出三個位置。 locus 指的是一個位置;allele 指的是該位置上可能出現的其中一種序列(SNV 情況可由單一鹼基表示); genotype 描述單一位置上兩份 allele 的組合; haplotype 則是跨越多個位置、同一條染色體上的一整串 allele。 最下方對比未定相與已定相的寫法:斜線只說「有哪兩份」, 豎線多說了「哪一份在哪一條染色體上」。 同一段染色體,兩份拷貝 第一條 A C G 第二條 T C A 位置 ① 位置 ② 位置 ③ locus 一個位置 上圖有三個 locus allele 該位置上的一種序列 位置① 有 A 與 T 兩種 A T genotype 單一位置上兩份的組合 位置① 是「一份 A、一份 T」 A / T haplotype 跨越多個位置的一整串 第一條是 A–C–G VCF 裡的兩種寫法 A / T 「有一份 A、一份 T」 但沒說哪一份在哪一條上(未定相) A | T 「第一條是 A、第二條是 T」 多說了位置歸屬(已定相)
同一段染色體上標出三個位置。注意 genotype 只描述單一位置(那一格上有哪兩份),而 haplotype 跨越多個位置(同一條染色體上的一整串)。最下面是兩種寫法的差別。

關鍵差別在最後兩個:genotype 是單一位置的,haplotype 是跨越多個位置的。 genotype 說「這裡有一份 A、一份 G」,但沒說 A 跟隔壁位置的 C 是不是在同一條染色體上。 補上這個資訊,正是 要推定的關係之一。

VCF 可用下列符號表示這項差異:

寫法意思
0/1(斜線)未定相。一份 ref、一份 alt,但不知道哪份在哪條上
0|1(豎線)已定相。第一條 haplotype 是 ref,第二條是 alt

phasing 會以 reads 或統計模型推定等位基因在不同染色體拷貝上的歸屬; VCF 可使用豎線表示已推定的相位結果。

heterozygous 位點提供主要 phasing 資訊

一個 locus 若兩份 allele 不同(,例如 0/1), 在讀取品質足夠的簡化模型中,可用來區分兩條 haplotype —— 看到 A 的 read 可歸到一條,看到 G 的可歸到另一條。

若兩份相同(),該位點本身通常不能區分兩條 haplotype。

het 位點密度是影響 phasing 的因素之一;讀長、coverage 與錯誤率也會影響可建立的相位範圍。

腫瘤中的 (loss of heterozygosity,異型合子性喪失)可能使一個區段失去其中一種 allele, 使原本可用的 heterozygous 位點減少,因而降低可用的 phasing 錨點。

因此,僅依這些錨點的 phasing 在 LOH 區段會更困難,可能需要其他證據或專門方法; 實際影響取決於 LOH 型態、coverage、purity 與演算法。

germline 與 somatic

germline variant 與 somatic variant 的來源差別 左半部:父方與母方的生殖細胞各帶有變異,受精後形成的胚胎通常在多數細胞裡都有這些變異, 並可能傳給下一代,這叫 germline variant。 右半部:個體長大過程中某個非生殖系細胞分裂時新產生的變異,可只存在於它的後代細胞裡, 通常不以遺傳方式傳遞,這叫 somatic variant。 Germline variant 與生俱來,來自父母 父方生殖細胞 母方生殖細胞 受精卵 通常存在於多數細胞 · 可能傳給子代 Somatic variant 後天產生,可限於部分細胞 正常細胞 分裂時出錯 新增 somatic 突變 持續增生 沒有突變 帶有突變的那一群 可限於部分細胞 · 通常不以遺傳方式傳遞
左:germline 變異通常存在於多數細胞,並可能傳給子代。右:somatic 變異在非生殖系細胞譜系中取得,可只存在於部分細胞,通常不以遺傳方式傳遞。腫瘤研究常特別關注 somatic 變異;germline 變異也可能影響風險、治療與 phasing。
來源生殖系;可能由親代遺傳或 de novo 形成非生殖系細胞譜系
分布通常存在於多數細胞(視嵌合而定)可限於部分細胞,也可能為 clonal
是否可傳給子代可能,但不代表必然傳遞通常不以遺傳方式傳遞
典型 在二倍體且無污染/CNV 時,het 常接近 0.5受 purity、copy number、multiplicity 與 clonality 影響
在本課程示例中的角色工具 —— 可作為 phasing 的錨點分析目標 —— 需依流程與證據判定

在特定 somatic calling 流程中,germline calls 常被排除;然而 heterozygous germline 也可作為建立 haplotype 骨架的錨點之一。錨點不足時,區分 HP1/HP2 及連結 somatic 變異會更困難。

clone 與 subclone

回到 M1 的簡化區段模型。一個細胞取得突變後增生,形成一群共享可辨識突變的細胞,稱為 。 其中某些細胞又取得新突變、再擴增,就形成

許多 somatic 變異可能是 passenger;可提高生長或存活優勢的候選變異稱為 , 其判定需依癌別與功能證據。

治療可能改變不同細胞群的相對比例,使具有抗藥優勢的 subclone 富集:

clone 與 subclone 如何形成,以及治療後抗藥群比例如何變化 上排由左至右是時間軸:一個正常細胞取得第一個突變後增生,形成帶有相同突變的一群細胞,這叫 clone。 其中部分細胞又取得新突變並各自擴增,形成兩個 subclone,其中一個帶有抗藥突變。 下排以簡化模型顯示治療的後果:藥物可優先減少沒有抗藥突變的細胞, 原本只佔一小部分的抗藥 subclone 可能因此成為主要群體,並伴隨腫瘤復發。 這說明為什麼只知道「有哪些突變」不夠,還要知道「這些突變分別在哪一群細胞裡」。 時間 ① 起點 一個正常細胞 ② 增生成 clone 全都帶著同一個突變 ③ 分支成 subclone subclone A subclone B 帶有抗藥突變 ④ 治療前的組成 75% subclone A(無抗藥性) 5% subclone B 治療之後發生什麼事 給藥 優先減少非抗藥細胞 subclone A 大幅減少 B 存活 B 開始擴增 模型中:B 比例上升 本模型中 B 約佔 95% 只知道「有哪些突變」不夠 治療前的報告會說:這顆腫瘤有 「第一個突變」與「抗藥突變」兩個。 但這樣寫看不出抗藥突變只在一小群細胞裡。 還要知道「分別在哪一群細胞裡」 如果知道抗藥突變獨立成一群、只佔 5%, 可提高治療後比例上升的預期,但並非必然。 這種細胞組成的不均勻叫 intratumour heterogeneity。
上排示意細胞取得變異、形成 clone,並再分支為兩個 subclones,其中一群帶有抗藥變異。下排是簡化治療模型:非抗藥群大幅減少後,抗藥 subclone 的相對比例由 5% 上升至 95%;真實反應仍取決於藥物、變異與腫瘤生態。

因此,除列出腫瘤中的變異外,也需評估這些變異可能分布於哪些細胞群。 這種細胞組成的不均勻,就叫

真實證據

評估方法時需有可供對照的高可信度參考標註。 truth set 通常由多種技術與證據建立,但仍可能包含不確定區域;benchmark 還包含評估範圍與程序。

以下列出六個具有參考標註的癌症細胞株作為示例:

細胞株癌別常用的 truth set
HCC1395乳癌SEQC2(示例參考集)
COLO829黑色素瘤NYGC
HCC1937乳癌Google(多工具交叉比對)
HCC1954乳癌Google
H1437肺癌Google
H2009肺癌Google

這些細胞株具有可用的配對正常樣本與參考標註,可提供區分 germline 與 somatic 的重要對照; 實際判定仍受 coverage、污染、變異類型與參考集品質影響。

HCC1395 將於後續示例中再次出現;可比較兩份資料: HCC1395_HKUHCC1395_NYGC同一個細胞株、不同的 與分析流程。 兩份資料的組成相似度(0.909)可作為跨流程一致性的觀察,但不能單獨證明方法穩健性。 因此, 應視為重要實驗變數,而非附註。

判讀練習

某個位點在腫瘤樣本裡的 VAF 是 0.50,在配對的正常樣本裡也是 0.50。

它比較可能是 germline 還是 somatic?

展開答案

在本題假設下,結果較支持 heterozygous germline。

若為二倍體、normal coverage 足夠,且無污染、拷貝數變化或嵌合, 腫瘤與正常樣本均接近 0.5 的 VAF 與 heterozygous germline 相容。

但有兩種例外要知道:

  • 正常樣本被腫瘤污染了。採檢時如果「正常」組織裡混進少量腫瘤細胞, 那麼腫瘤特有的變異在正常樣本裡也會出現訊號
    分辨時可檢查訊號強度:在二倍體且無其他偏差時,germline het 變異常接近一半的 read, 污染訊號常低於完整 germline 訊號,但實際數值仍取決於污染比例、copy number 與取樣。
  • 該位置的染色體份數不是兩份。如果某段染色體被複製或刪掉了 (這在腫瘤裡很常見), 那麼「一份有、一份沒有」的算法就不成立,VAF 自然偏離 0.5。

練習與自我檢核

三項概念檢核

可先自行回答,再核對下方解析:

  1. 「這個位置有一份 A、一份 G」—— 這句話講的是 genotype 還是 haplotype?
  2. 0|10/1 多告訴你什麼?
  3. 為什麼 heterozygous 位點通常比 homozygous 位點更能提供 phasing 資訊?

答案依序是:genotype(單一位置)/多告訴你「哪一份在哪一條染色體上」/ 因為兩份 allele 不同時,才提供區分兩條染色體的訊號;homozygous 位點通常無法單獨區分。

在實際資料中檢查

若已有一份 VCF,可使用下列指令檢查 genotype 分布:

# 各種 genotype 各有多少個
bcftools query -f '%POS\t[%GT]\n' sample.vcf | cut -f2 | sort | uniq -c | sort -rn

# 只留下 heterozygous 的位點(phasing 能用的錨點)
bcftools view -g het sample.vcf | grep -vc '^#'

het 位點密度會影響 phasing,亦需同時考慮讀長、coverage 與品質。 人類全基因體中的 het 位點通常為數百萬量級,但會因族群、參考基因組、callable region 與過濾條件而異;請以資料集統計為準。

學習檢核

本模組術語

LOH(異型合子性喪失)
原本 heterozygous 的區域變成只剩一種 allele。LOH 不等於缺失 —— 也可能是一條 haplotype 遺失後另一條被複製(copy-neutral LOH)。
PS tag(phase set)
標示某群 variants 屬於同一 phase block 的編號。同一 PS 內的相位方向可相互比較;不同 PS 的 HP1/HP2 方向彼此獨立。
SNP(單核苷酸多型性)
族群中以多型形式存在的單一鹼基差異;本教材主要以可作為 phasing 錨點的 germline SNP 為例。
SNV(單核苷酸變異)
單一鹼基的改變。與 SNP 的差別在於 SNV 不預設它在族群中常見 —— 腫瘤裡新產生的單點突變叫 somatic SNV(sSNV),不叫 SNP。
VAF(變異等位基因頻率)
在某個位點上,支持 alt allele 的 read 佔全部 read 的比例。VAF 不等於帶有這個突變的細胞比例
allele(等位基因)
同一個 locus 上可能出現的其中一種序列版本。在一般二倍體常染色體位點,個體通常有兩份 allele;性染色體、拷貝數變化與腫瘤基因體可能不符合這個簡化模型。
basecalling(鹼基判讀)
把定序儀的原始訊號(ONT 是電流)轉成 A/C/G/T 字母的步驟。不同 basecaller 版本會產生不同的錯誤特性 —— 所以「同一個細胞株、不同 basecaller」是兩份不同的資料集。
clone(克隆)
源自共同祖先細胞,並共享一組可辨識 somatic mutations 的細胞群。
diploid(二倍體)
正常人多數常染色體區段通常有兩份拷貝的狀態;性染色體、拷貝數變化與腫瘤細胞可能不同。
driver mutation(驅動突變)
可提升腫瘤細胞生長或存活優勢的候選變異;passenger mutation 通常不具有已知的選擇優勢。
genotype(基因型)
某個 locus 上觀察到的 allele 組合;對一般二倍體常染色體位點,通常是兩份 allele。VCF 裡寫成 0/1(未定相)或 0|1(已定相)。
germline variant(生殖系變異)
在生殖系形成、通常存在於多數細胞的變異;可遺傳給子代,但不代表必然傳遞。
haplotype(單倍型)
同一條實體染色體拷貝上,具有一致相位的一組 alleles 或 variants。HP1 與 HP2 是任意的相對標籤。
heterozygous(異型合子)
在一般二倍體位點上,兩份 allele 不同(例如一份 A、一份 G)。此類位點可作為區分 haplotype 的資訊錨點;複雜拷貝數情況需另行解讀。
homozygous(同型合子)
在一般二倍體位點上,兩份 allele 相同。此位點本身通常無法用來區分兩條 haplotype。
intratumour heterogeneity(腫瘤內異質性)
同一腫瘤內不同細胞可帶有不同突變組合,因而同時存在多種基因型。
locus(位點)
基因體上的一個特定位置。講「這個 locus」時通常指某個座標,例如 chr1:162,404,043
phasing(定相)
為可判定的 variants 建立其位於不同實體染色體拷貝上的相位關係;VCF 常以 0|1 等形式表示。長 read 可提供跨位點的分子層級觀測證據。
provenance(資料來源履歷)
記錄資料來源、細胞株、定序平台、basecaller、reference build、caller、benchmark 與混樣方式。在本實驗室中,這些資訊是重要實驗變數,而非附註。
somatic variant(體細胞變異)
在非生殖系細胞譜系中、通常於受精後取得的變異;可只存在於部分細胞,通常不由親代遺傳給子代。癌症基因體學常分析此類變異。
subclone(次克隆)
clone 內取得額外變異並擴增的子群;治療後可能富集具有抗性的 subclone。