模組 1 · A simplified tumour-region model

腫瘤樣本的簡化區域模型

以簡化模型說明:bulk 定序通常無法保留 read 的細胞來源,但可以保留同一分子跨位點的連結。

約 30 分鐘建議先修:學習導覽

本模組學習目標

  • 解讀教學用簡化區段模型,並說明四群細胞與三個突變的關係
  • 說明標準 bulk 定序為何不保留 read 與來源細胞的對應關係
  • 在明確列出的簡化假設下,由細胞比例推算 VAF
  • 區分 read 提供的分子層級觀測與由多條 read 建立的細胞群推論
  • 說明 haplotype、germline variant、somatic variant、clone 與 subclone 在本模型中的基本角色

為什麼重要

本教材採用同一個簡化模型連結多項概念。本模組先完整建立細胞、DNA 分子與 read 的基本關係, 並在專有名詞首次出現時提供本頁所需的簡要定義。

本模型聚焦於一個核心問題:腫瘤檢體經過標準 bulk 定序後,資料保留了哪些資訊, 又不再包含哪些細胞層級資訊?

本模組的四項核心概念

  1. 同一份腫瘤檢體可以包含多個細胞群。
  2. 標準 bulk 定序混合多個細胞來源的 DNA,因此不保留 read 與來源細胞的對應。
  3. 一條 read 來自單一 DNA 分子的局部序列,而非一個完整細胞。
  4. 若同一條 read 的觀測範圍涵蓋兩個突變,兩者的共同出現可直接支持其位於同一條 DNA 分子。

本模組使用少量英文術語作為圖例與群組名稱。下方資料表會先提供足以解讀本模型的定義; 較完整的生物學與資料格式定義會在各自的主題模組中展開。

概念與互動

基本資料模型

概念本模組採用的定義
位點(locus)DNA 序列中的特定位置;S1、S2、S3 代表三個不同位置
染色體拷貝本簡化模型假設每個位置有兩份 DNA 拷貝,分別標示為 HP1 與 HP2
變異(variant)相對於參考序列的 DNA 序列差異
定序儀對單一 DNA 分子局部序列的觀測
在特定位點上,支持變異的 read 佔全部涵蓋該位點 read 的比例

教學用簡化區段模型

教學用簡化區段模型:腫瘤樣本中的四個細胞群 左側表示樣本中的四個細胞群:正常細胞、最早出現的腫瘤細胞群,以及兩個後續分支。 右側表示同一染色體區段的兩份 DNA 拷貝 HP1 與 HP2,以及依序出現的三個體細胞變異 S1、S2、S3。 本模型設定 S1 位於 HP1 且由所有腫瘤細胞群共享;S2 僅位於後續分支 1;S3 僅位於後續分支 2。 最下方表示標準 bulk 定序混合多個細胞來源的 DNA 後,各變異的預期 VAF。 樣本中的四個細胞群 正常細胞 50% HP1 / HP2 未帶有本模型設定的 S1/S2/S3 最早腫瘤細胞群 20% +S1 本模型設定所有腫瘤細胞群均帶有 S1 後續分支 1 20% +S1 +S2 在原有 S1 的基礎上新增 S2 後續分支 2 10% +S1 +S3 另一後續分支,新增 S3 各細胞群的 DNA 組成 S1 S2 S3 HP1 HP2 綠點:遺傳的序列差異,可區分兩份 DNA 拷貝 HP1 HP2 HP1 HP2 HP1 HP2 標準 bulk 定序混合多個細胞來源的 DNA 後,可直接觀測: S1 S2 S3 VAF 0.25 VAF 0.10 VAF 0.05 細胞比例 50% 細胞比例 20% 細胞比例 10% read 與來源細胞的對應 在標準 bulk 流程中 通常無法取得
左側呈現樣本中的四個細胞群,右側呈現各群對應的 DNA 組成;下方則表示標準 bulk 定序後可觀測的 VAF。橫線區隔細胞層級組成與定序後的分子層級資料。

圖中元素的意義如下:

圖中元素代表意義
灰色細胞正常細胞,佔 50%
紅/藍/橘色細胞三個腫瘤細胞群;最早形成者為 founder ,由其分出的後續細胞群為
藍色長條 HP1/橘色長條 HP2同一段染色體的兩份 DNA 拷貝;跨多個位置的一組序列差異構成
綠點由親代遺傳、存在於多數體細胞的 ;常見的單一核苷酸差異稱為 ,可協助區分 HP1 與 HP2
紅點 S1/S2/S3受精後新產生、僅存在於部分細胞譜系的

三個變異代表不同的細胞譜系階段

三個變異在細胞群中的分布反映其出現的先後與分支關係:

  • S1 先出現,因此紅、藍、橘三個腫瘤細胞群皆帶有 S1。
  • S2 出現於後續分支,僅存在於藍色細胞群。
  • S3 出現於另一後續分支,僅存在於橘色細胞群。
三個變異出現的先後順序,決定了哪些細胞群帶有它 左側是細胞分裂的譜系樹:正常細胞先獲得 S1,成為最早的腫瘤細胞群; 這一群之後分成兩支,一支再獲得 S2,另一支再獲得 S3。 右側把同一件事換成「哪些細胞群帶有這個變異」的橫條: S1 在分支之前就出現,所以三個腫瘤細胞群都有,合計佔樣本 50%; S2 與 S3 分別只在自己那一支裡,各佔 20% 與 10%。 因此變異在樣本中佔的比例不是隨機的,而是由它出現在譜系樹的哪個位置決定: 愈早出現的變異被愈多細胞群共享,看起來就愈常見。 變異出現的先後 正常細胞 S1 最早腫瘤細胞群 帶 S1 S2 S3 後續分支 1 帶 S1 + S2 後續分支 2 帶 S1 + S3 分支之前發生的變異,會被之後所有細胞群繼承。 哪些細胞群帶有它 0% 100% 的細胞 S1 = 50% 20% 20% 10% S2 = 20% 只有後續分支 1 S3 = 10% 只有後續分支 2 愈早出現的變異,被愈多細胞群共享。 所以「它佔多少比例」帶著「它多早出現」的訊息 —— 這正是後面要從 VAF 反推腫瘤內部結構的依據。
左邊是細胞分裂的順序,右邊是同一件事換成「佔多少細胞」的長度。S1 在分支之前出現,所以之後長出來的三群都繼承了它,加起來 50%;S2 與 S3 各自只在自己那一支裡。變異佔的比例不是隨機的,它帶著「這個變異在譜系樹上多早出現」的訊息。

本模型另設定 S1、S2、S3 均位於 HP1。在此簡化情境中,每個新增變異最初發生於其中一份 DNA 拷貝,因此可以進一步分析變異與 HP1 或 HP2 的分子連結。此處的 HP1/HP2 是方向任意的相對標籤, 不代表父系或母系。

由細胞比例推算 VAF

VAF 是支持特定變異的 read 比例。在本模型的假設下,可由細胞比例推算其預期值。 以 S1 為例:

  • 帶有 S1 的細胞比例 = 紅色群(20%)+ 藍色群(20%)+ 橘色群(10%)= 50%
  • 本模型假設每個細胞在此位置有兩份 DNA 拷貝,而 S1 僅位於其中一份(HP1)
  • 因此,支持 S1 的預期 read 比例為 50% × ½ = 25%
從細胞比例算到 VAF:那個「除以 2」是從哪裡來的 以 S1 為例,分成三步。第一步:帶有 S1 的細胞佔全樣本 50%, 由最早腫瘤細胞群 20%、分支 1 的 20%、分支 2 的 10% 相加而得。 第二步是關鍵:定序看到的不是細胞,而是 DNA 分子。 每個細胞在這個位置貢獻兩份拷貝 HP1 與 HP2,而 S1 只在 HP1 上, 所以就算是帶有 S1 的細胞,它交出來的兩份分子裡也只有一份帶 S1。 第三步:把分子數目當成分數的分子與分母 —— 100 個細胞交出 200 份分子, 其中帶 S1 的是 50 份,VAF 等於 50 除以 200,也就是 0.25。 因此 VAF 0.25 對應的是 50% 的細胞,不是 25% 的細胞; 兩者差的正是每個細胞有兩份拷貝這件事。 ① 先數細胞 帶有 S1 的細胞群 最早腫瘤 20% 分支 1 20% 分支 2 10% 合計 50% 的細胞帶有 S1 ② 但定序看到的是 DNA 分子,不是細胞 帶 S1 的細胞 (50% 的細胞) 交出 HP1 ← 這一份帶 S1 HP2 ← 這一份不帶 每個細胞兩份拷貝, 變異只在其中一份上。 所以帶有 S1 的細胞,也只有一半的 分子帶著 S1 —— 這就是那個「÷2」。 ③ 把分子數當成分數 假設樣本裡有 100 個細胞 → 交出 200 份 DNA 分子 其中帶 S1 的:50 個細胞 × 1 份 = 50 份 50 200 = 0.25 注意:VAF 0.25 對應的是 50% 的細胞,不是 25% 的細胞。
那個「÷2」不是慣例,它是單位換算:第一步數的是細胞,第三步數的是 DNA 分子,而每個細胞在這個位置交出兩份分子。中間那一格就是換算率。看懂這張圖之後,「VAF 0.25 代表 25% 的細胞」為什麼是錯的,就不必背了。

因此圖中標示 S1 的預期 VAF 為 0.25。依相同假設,S2 與 S3 的預期 VAF 分別為 0.10 與 0.05。

bulk 定序保留與未保留的資訊

read 內的分子連結

在標準 bulk 定序資料中,read 與來源細胞的對應關係不會被保留;輸出是一組來自多個細胞的 DNA 片段序列。因此,無法僅由這些資料直接辨識每條 read 原先所屬的細胞群。

然而,read 內仍保留分子層級的連結資訊。若某條 read 同時涵蓋兩個變異, 該觀測可直接支持兩個變異位於同一條 DNA 分子。

這項分子連結構成本教材後續分析方法的共同證據基礎:

本教材的核心推論問題

長 DNA 分子可以提供哪些 DNA 變異與分子狀態共同出現的證據?

後續模組將分別處理此問題所需的生物學定義、定序限制、資料格式與推論方法。

與 single-cell 定序比較

bulk 與 single-cell 定序所保留及未保留的資訊 左側表示 single-cell 定序:先分離並標記個別細胞,因此可保留 read 與來源細胞的對應, 並比較不同細胞的變異組合;其限制通常包括較高成本與較低的單細胞資料量。 右側表示標準 bulk 定序:多個細胞來源的 DNA 混合處理後,read 通常無法對應至來源細胞。 若 read 同時涵蓋兩個變異且判讀可靠,仍可直接支持兩者位於同一條 DNA 分子。 此 read 內的分子連結是本教材後續方法的共同證據基礎。 single-cell 定序 先分離並標記個別細胞 來自細胞 1 的 read 來自細胞 2 的 read 來自細胞 3 的 read 保留:read 的來源細胞標籤 可比較不同細胞的變異組合 限制 成本較高;每細胞資料量通常較少 標準 bulk 定序(本教材聚焦) 多個細胞來源的 DNA 混合處理 混合 DNA 通常無法取得:read 的來源細胞 未加入細胞標籤時,無法由 read 直接判定 保留:read 內的分子連結 同一 read 涵蓋兩個變異 → 支持兩者位於同一分子 本教材後續方法採用的共同證據基礎: bulk 不保留來源細胞對應,但可保留 read 內的分子連結。
左側:single-cell 定序先分離個別細胞,因此可保留 read 與來源細胞的對應,但通常面臨較高成本與較低的單細胞訊號量。右側:標準 bulk 定序不保留 read 的細胞來源;若 read 同時涵蓋兩個變異,仍可保留兩者位於同一 DNA 分子的連結證據。

single-cell 定序會先分離個別細胞再進行定序,因此可追溯 read 的細胞來源, 並直接比較不同細胞的變異組合。

相較之下,single-cell 定序通常需要在成本、細胞數與單細胞覆蓋度之間取捨。 本教材聚焦於 bulk 定序,因此細胞群結構屬於根據分子連結建立的推論模型,而非直接的細胞層級觀測。 後續分析均需維持此證據層級的區分。

判讀練習

假設某條 read 同時涵蓋 S1、S2、S3,並觀察到 S1 = ALT、S2 = ALT、S3 = REF。

依據本模組的簡化模型,哪一個細胞群與此變異組合相容?

展開答案

此組合與藍色細胞群(後續分支 1)相容,因為該群帶有 S1 與 S2,但不帶有 S3。

精確的表述為:此 DNA 分子的變異組合與藍色細胞群的模型相容。

直接觀測的對象是一條 DNA 分子,而非完整細胞群。若要支持特定細胞群的存在, 仍需多條獨立 read 呈現一致組合,並排除定序與比對錯誤。此結論屬於資料支持的模型推論, 而非直接的細胞層級觀測。

練習與自我檢核

VAF 計算練習

依據上圖的細胞比例與本模組的簡化假設,計算三個變異的預期 VAF:

變異帶有它的細胞比例÷2(因為只在一條染色體上)預期 VAF
S120 + 20 + 10 = 50%50% ÷ 20.25
S220%20% ÷ 20.10
S310%10% ÷ 20.05

VAF 推論的限制

若三個變異的 VAF 分別為 0.30、0.30、0.08,是否可以據此推論 「前兩個變異位於同一細胞群,且第三個變異較晚出現」?

不可以。VAF 是各位置獨立統計的 read 比例,不包含變異共同出現或發生順序的資訊。 因此,相同 VAF 不代表兩個變異位於同一條分子,較低 VAF 也不能單獨證明變異較晚出現。 可支持的結論僅為:「第三個變異的相對 read 支持較少;其細胞分布與發生順序仍需分子連結及其他證據判定。」

分析與報告時應明確區分三個層級:直接觀測、資料支持的模型推論,以及目前證據無法支持的結論。

學習檢核

本模組術語

SNP(單核苷酸多型性)
族群中以多型形式存在的單一鹼基差異;本教材主要以可作為 phasing 錨點的 germline SNP 為例。
VAF(變異等位基因頻率)
在某個位點上,支持 alt allele 的 read 佔全部 read 的比例。VAF 不等於帶有這個突變的細胞比例
clone(克隆)
源自共同祖先細胞,並共享一組可辨識 somatic mutations 的細胞群。
germline variant(生殖系變異)
在生殖系形成、通常存在於多數細胞的變異;可遺傳給子代,但不代表必然傳遞。
haplotype(單倍型)
同一條實體染色體拷貝上,具有一致相位的一組 alleles 或 variants。HP1 與 HP2 是任意的相對標籤。
read
定序儀產生的一段序列觀測。一條 read 通常來自一個 DNA 分子的片段,但不等同於一個細胞;仍需考慮重複、嵌合與定序錯誤。
somatic variant(體細胞變異)
在非生殖系細胞譜系中、通常於受精後取得的變異;可只存在於部分細胞,通常不由親代遺傳給子代。癌症基因體學常分析此類變異。
subclone(次克隆)
clone 內取得額外變異並擴增的子群;治療後可能富集具有抗性的 subclone。