模組 0 · Orientation

研究主題與學習路徑

從細胞、染色體與 DNA 建立定序資料的基本模型,再說明與治療決策相關的分子關聯問題。

約 20 分鐘

本模組學習目標

  • 說明細胞、染色體、DNA、基因、突變與 read 之間的關係
  • 解釋定序如何將 DNA 轉換為可計算分析的資料
  • 區分「辨識突變」與「推定突變間的分子連結」兩類問題
  • 說明三項工具的依賴關係與後續學習路線

先建立最小的生物模型

本模組先從基本概念開始,暫不引入癌症、EGFR 或其他縮寫。理解下列五個層次的關係後, 即可建立後續模組所需的資料模型:

從細胞、染色體與 DNA 到定序 reads 五個由左到右的層次。第一格是一個有細胞核的細胞。第二格把細胞核放大,顯示兩份相似的染色體。 第三格把一條染色體展開成由 A、C、G、T 組成的長 DNA,並框出其中一段基因。 第四格是定序儀,把抽出的 DNA 片段逐段量測。第五格是電腦收到的多條 read, 每一條 read 通常是源自一條實體 DNA 分子的局部序列觀測。圖下方標示左側屬於人體裡的物理世界, 右側是量測後的資料世界。 一層一層放大:人體裡的 DNA,如何變成電腦裡的 reads? 1 細胞 一管檢體裡 有很多細胞 DNA 主要收在細胞核中 檢體也可能含細胞外 DNA 放大 2 染色體 多數常染色體有兩份 一份通常來自父親 一份通常來自母親 兩份相似,但不完全相同 展開 3 DNA 與基因 A C G T A T G C A T 基因 DNA 長字串中 具有功能的一段 染色體 = 一條很長的 DNA 量測 4 定序 逐段讀取 DNA 轉成 A/C/G/T 這一步把實體分子 變成電腦資料 輸出 5 reads 每條橫線是一段 局部 DNA 觀測 電腦拿到很多片段 不是一條完整染色體 人體裡的物理世界:細胞 → 染色體 → DNA 分子 量測後的資料世界:定序 → reads 分析流程將 reads 比對至參考 DNA,再由 variant-calling 產生候選變異清單。
左側示意人體內的生物結構:細胞核內含染色體;在本教材的簡化模型中,每條染色體可視為一條長 DNA 分子,基因則是 DNA 上具有特定功能的區段。定序對 DNA 分子進行片段化量測,輸出 A/C/G/T 字串,也就是 reads。

人體細胞核內含有染色體。在本教材的簡化模型中,每條染色體可視為一條長 DNA 分子; DNA 以 A、C、G、T 四種鹼基記錄序列資訊。多數正常常染色體具有父源與母源兩份拷貝; 性染色體與腫瘤拷貝數異常將於後續模組另行說明。

基因不是另一種物質,而是 DNA 序列中具有特定功能的區段;可將其類比為程式系統中的模組。 當其中某個位置相對參考序列發生差異,稱為變異;「突變」則常用於描述新取得的變化。 部分變異可能影響蛋白質功能或治療反應,仍需依變異與情境判定。

「定序」到底做了什麼

我們無法把一整條染色體直接貼進文字編輯器。實際流程是:

  1. 從檢體取出大量 DNA 分子。
  2. 定序儀逐段量測 DNA,把每一段轉成 A/C/G/T 字串。
  3. 每一段序列觀測稱為一條 read;依平台與定序深度,一個樣本可產生大量且部分重疊的 reads。
  4. 電腦把 reads 對回人類參考序列,找出不同的字母位置。
參考序列:... A C G T T A C G ...
某條 read:... A C A T T A C G ...
                     ↑
                 這裡有一筆差異

所以定序資料不是「病人的完整基因組序列」,而是很多條來自不同實體 DNA 分子的局部觀測。 分析流程先將它們比對至參考序列,再由 variant-calling 步驟產生候選變異清單。

與治療決策相關的示例

EGFR 是一個編碼細胞生長訊號相關蛋白質的基因。 部分帶有活化 EGFR 變異的肺癌可受益於特定 EGFR 抑制劑;另一些變異則可能降低特定藥物的抑制效果。 實際治療判定仍需依藥物、變異與臨床情境評估。

一位非小細胞肺癌病人在治療後,檢測報告同時找到 EGFR 上的 T790MC797S。這兩個名字只是「EGFR 的哪個位置、變成什麼」的標籤; 現在不用記。重要的是:報告只告訴我們兩個突變都存在,卻沒有回答它們是否在同一份 EGFR DNA 上。

報告已知:detected("T790M") = true
          detected("C797S") = true

還不知道:same_DNA_molecule("T790M", "C797S") = ?

下面每一條橫線是一條 read。實心點表示該 read 帶有那個突變, 空心點表示該位置與參考序列相同。先只根據圖上的分子證據作答:

互動練習
兩個突變是一起出現在同一份 DNA 上,分開在兩份 DNA 上,還是目前的觀測其實不足?
read 顯示的排列分子層次發生什麼研究中的治療意義
分開在兩份 DNA 上 兩個抗藥改變位在不同的 EGFR 分子上 在特定研究模型中,第一代與第三代 EGFR 藥物的組合可能分別抑制兩份分子
一起在同一份 DNA 上 兩個抗藥改變疊在同一個 EGFR 分子上 在該研究模型中,同樣的藥物組合未能有效抑制此排列

這個案例來自 Niederst 等人的原始研究;後續也有 依排列方式選藥的臨床案例。 這裡用它說明「分子關係會改變決策」,不是提供個別病人的治療建議。

研究主題摘要

本課程介紹如何以計算方法,從定序 reads 推定哪些 DNA 變異位於同一實體分子, 並在腫瘤混合與定序誤差下評估此關係的可信度。

同樣找到兩個突變,read 圖可能給三種答案

前面的 EGFR 報告只說「T790M 有、C797S 也有」。要知道兩者的排列, 需回到產生這張清單的原始 reads。在本簡化情境中,可能的判讀可分為下面三種:

同樣找到突變 A 與 B 時,read 圖可能給出的三種答案 三個並排的 read 圖。在讀取品質足夠且無明顯嵌合的簡化前提下,左圖中多條跨越兩個位置的 reads 同時帶有 A 與 B,支持兩者位在同一份 DNA。 中圖中,跨越兩個位置的 reads 穩定分成只帶 A 與只帶 B 兩群,支持兩者分開在兩份 DNA。 右圖中,reads 太短,只能各自看到 A 或 B,沒有任何一條 read 能同時觀察兩點,所以資訊不足。 先問「read 看不看得到兩點」,再問「兩個點如何組合」 ① 支持同一份 DNA 突變 A 突變 B A 與 B 一起出現 多條獨立 read 都看到相同組合 結論:同一份 ② 支持分開在兩份 突變 A 突變 B A-only 與 B-only 每條 read 都跨兩點,組合卻分開 結論:分開 ③ 資訊不足 突變 A 突變 B 沒有 read 同時看見兩點 「沒看見一起」不等於「證明分開」 結論:不知道 共同前提:同一條 read 需在品質足夠時同時觀察 A 與 B,才可支持對兩者關係的判斷。
左:在讀取品質足夠時,多條 read 同時帶 A 與 B,支持兩個突變在同一份 DNA。中:跨越兩點的 reads 穩定分成 A-only 與 B-only,支持分開在兩份 DNA。右:reads 太短,沒有一條能同時觀察兩點,因此只能回答「不知道」,不能誤判成分開。

判讀順序先看範圍,再看實心點。如果同一條 read 根本沒有機會同時看見兩個位置, 目前只能判定資訊不足;只有在 read 確實跨過兩點且品質足夠時,點的組合才可支持「同一份」或「分開」的解釋。

長 read 通常可增加同一次觀測涵蓋的距離,但實際可連結範圍仍取決於讀長分布、覆蓋度與品質。 上面的 EGFR 兩點很近,短片段也可能回答;實際分析也可能處理相距數千至數萬 bp 的變異。 定序技術之間的長度與準確度取捨,留到定序單元完整比較。

兩位點問題如何延伸為三種分析情境

前述圖示只包含兩個突變,且假設 reads 品質良好。真實研究處理相同類型的問題, 但資料會逐層變難:先擴大到整個基因體,再加入腫瘤混合,最後還可能拿不到同一病人的正常檢體。 三項工具分別處理這三個層級的分析條件。

同一個 read 關係問題如何對應三類分析工具 最上方是共同問題:從大量 reads 推定哪些突變位在同一條 DNA 分子上。 第一層 LongPhase 把兩位點的直覺擴大到一般樣本的全基因體資料。 進入腫瘤後,資料多了正常細胞混合、低比例突變與更多錯誤訊號,並依是否有同一病人的正常檢體分岔。 有正常檢體時使用 longphase-s 做直接對照;只有腫瘤檢體時使用 longphase-to,需整合更多間接證據。 同一個問題,資料情境不同就對應不同方法 共同研究問題 從 reads 恢復: 哪些突變位在同一條 DNA? 上一節的兩位點判讀,是此分析問題的最小示例。 從兩個位置擴大到全基因體 LongPhase 一般樣本 建立基礎能力 根據大量 reads 推定 分子關係與其可信度 進入腫瘤:多了混合、低比例訊號與更多假象 關鍵分岔:有沒有同一病人的正常檢體可以直接比較? 腫瘤 正常 longphase-s 有直接對照 同一病人的正常檢體可協助排除混淆 腫瘤 沒有正常 longphase-to 缺少直接對照 需整合更多間接訊號補足資訊
同一個研究問題逐層變難。LongPhase 先在一般樣本中,根據大量 reads 推定突變是否位在同一條 DNA 上。進入腫瘤後,longphase-s 可利用同一病人的正常檢體作直接對照;若只有腫瘤,longphase-to 需整合更多間接證據。

這三項工具共同說明如何將 read-level 判讀問題, 擴展為可處理人類基因體與腫瘤資料的分析方法。M11–M13 依相同層級排列: M11 是一般樣本,M12 加入腫瘤與正常對照,M13 再拿掉正常對照。

未觀察到證據,不等於證明不存在

現在換一組資料。每條 read 都太短,只能碰到一個位置:

read 1, 2, 3  → 只覆蓋左邊,看到 T790M
read 4, 5, 6  → 只覆蓋右邊,看到 C797S

沒有任何一條 read 同時看到兩個突變。你可以下結論說它們分開在兩份 DNA 上嗎?

展開答案

不可以,答案是資訊不足。

要回答 same_DNA_molecule(A, B),至少要有觀測範圍同時包含 A 與 B。 這批 read 從來沒有具備同時觀察兩者的能力,所以結果不是 false,而是 unknown

這個區分會一直出現:沒有支持證據可能代表關係不存在,也可能只是 read 太短、 數量太少或資料品質不夠。分析流程應將這些情況分開處理。

接下來的路線

此時不需先安裝軟體或另讀生物學教科書。請依序學習,各模組會在需要時引入新的概念與資料物件:

階段新增的問題
M1–M3 建立資料模型樣本、DNA、突變與定序片段到底是什麼?
M4–M5 讀懂輸入這些物件如何寫進 BAM/VCF,候選突變又怎麼被找出來?
M6–M10 做可信推理如何恢復分子關係,並處理腫瘤混合、甲基化與評估陷阱?
M11–M13 實作三項工具每個工具如何把前面的概念變成演算法、指令與輸出?
Capstone 獨立判讀面對一個真實位點,能不能說清楚證據、結論與不確定性?

本頁核心重點如下:

presence 不等於 relationship

知道突變 A 存在、突變 B 也存在,仍然不知道 A 與 B 是否來自同一條 DNA 分子。 後續單元將介紹如何以可檢驗的證據推定這個關係。

學習檢核