研究指引 · 純度、倍體與腫瘤 DNA 比例 · Part 3 — specification of the joint estimator
下篇:聯合估計式的規格,以及它還不能宣稱什麼 把三個通道寫成單一個似然而非懲罰與似然的混合,逐層攤開由參數到計數的生成模型,處理 c 與 μ 這兩個 nuisance,並界定它解決與未解決的不可辨識性、失效模式與實作分期。
建議先修:失衡的閉式與通道
本模組學習目標 寫出聯合估計式的完整形式,並說明為何它必須是單一個似然而非懲罰項與似然的混合 逐層寫出由全域參數到觀測計數的生成模型,並指出每一層各引入哪些 nuisance 參數 說明拷貝數分段與相位定向為兩件不同的工作,以及混用兩者會扭曲哪幾個通道 界定此估計式所解決與未解決的不可辨識性,並說明加倍未定時的輸出格式 列出實作分期,並說明每一期各自可以單獨驗證什麼
為什麼重要
中篇留下的四個缺口
中篇建立了機制:單倍型失衡有閉式,其形式與上篇的等位比例式相同;
somatic 掏空與拷貝數失衡是同一個分子裡的兩項,須在不同位點分別量測;
而單倍型內的 somatic 佔比提供一個對另一條單倍型免疫的純度訊號。
中篇同時指出四個缺口,本頁逐一處理:
缺口 本頁處理之處
位點層級的四格表尚未產生 第二節的第四層,以及第八節第一期
c 與 μ 為自由參數時純度只有下界第四節:以先驗積分掉,並回報區間
分段不能沿用 phase blockphase block 一段可建立連續相位關係的區域。read 長度不足、缺少 informative heterozygous 位點或證據不一致時,可能形成不同 phase blocks。 A contiguous stretch over which phasing is consistent. It can break when reads are too short, informative heterozygous sites are absent or evidence conflicts. 完整條目 → 第三節:兩件不同的工作
偵測與標記誤差尚未進入似然 第二節的第四層與第六節
本頁的位階:規格,不是已驗證的方法
以下所寫的是一個可實作、可反駁的規格 ——
每一層的參數、每一個通道的分布形式、每一期可單獨驗證什麼。
它尚未在任何真實或模擬資料上執行過 ,因此不宣稱優於現行的 DNA 比例迴歸;
後者在其所針對的量上已有 MAE 0.03 的實測成績。
此處要求的判準與教材模組不同:看的不是結論是否漂亮,
而是每一項假設是否寫得夠明確、足以被實測推翻。
概念與互動
一、完整的估計式
先寫出目標,其餘各節都是在拆解它。參數分三類:
全樣本單一的 cellular purity p ;每個拷貝數區段兩個整數 ( n 1, n 2 ) s ;
以及每個 somatic 位點的 ( c i , μ i ) ,後者為 nuisance,由先驗積分掉。
log L = log L depth + log L germline + log L somatic + log P ( CN , WGD ) 四項相加 ,且皆為對數機率 —— 尺度一致,可比較,亦可算資訊量。
第四項為簡約性先驗,對應上篇 PURPLE 的事件懲罰。
為何不能沿用上篇的分數形式
上篇的 PURPLE 分數為兩個加權平均相乘再加一個懲罰 。
把中篇的 somatic 通道接上去時,最直接的寫法是再加一個對數似然項 ——
但那樣寫在統計上不自洽,理由有三:
尺度無關。 懲罰項隨區段數與權重增長,似然項隨變異數與深度增長,
兩者之間沒有任何係數校準相對影響力。
資料組成會改變解。 高突變負荷的腫瘤上,整個目標函數被 somatic 項主導;
拷貝數變異密集而突變稀少的腫瘤上則相反。同一個方法在兩種腫瘤上等於兩個方法。
無法給出不確定性。 懲罰不是機率,故其最小值附近的曲率不對應任何區間。
改寫為單一似然之後,簡約性偏好進入先驗 而非進入分數,
三個通道各為一項,相對權重由各自的分布與樣本數自動決定,不需人為係數。
懲罰乘積加似然 vs 四項相加的對數機率
左邊是上篇那種分數的形狀:兩個加權平均相乘,再加上一個尺度無關的似然項。
三塊的高度隨資料組成而變 —— 突變多的腫瘤上,體細胞那一塊會把另外兩塊壓掉;
拷貝數變異多而突變少的腫瘤上則相反。
所以同一個方法用在兩種腫瘤上,實際上等於兩個不同的方法。
右邊是本頁的形式:四項都是對數機率,直接相加,
每一項的份量由它自己的樣本數與分布決定,不需要人為給係數。
簡約性偏好從分數裡搬到先驗那一項。
最下面標出最實際的差別:右邊的最大值附近有曲率,所以給得出區間;
左邊的懲罰不是機率,最小值附近的形狀不對應任何不確定性。
讀法是:能不能給出區間,取決於目標函數是不是一個機率。
目標函數的兩種寫法
左為沿用上篇的分數再加一項,右為改寫為單一似然。兩側的橫軸皆為資料組成。
懲罰乘積 + 似然
(Σ w·E) × (Σ w·D) + log L
突變少、拷貝數變異多
懲罰主導
突變多、拷貝數變異少
似然主導
兩塊的相對高度隨資料組成而變 ,
而兩者之間沒有任何係數校準。
同一個方法 = 兩個方法
四項對數機率相加
log L_depth + log L_germ + log L_som + log P
突變少、拷貝數變異多
突變多、拷貝數變異少
各項的份量由其樣本數與分布 自動決定,
不需人為係數;簡約偏好搬到最後一項的先驗。
尺度一致,可相加也可比較
最實際的差別在不確定性 :右式的最大值附近有曲率,故給得出區間、給得出多峰。
左式的懲罰不是機率 ,其最小值附近的形狀不對應任何區間 —— 只能回報一個點。
左為上篇的分數:兩個平均相乘,再加一個與其無關尺度的項;
三塊的高度刻意畫成隨資料組成變動 。右為本頁的形式:四項皆為對數機率,
相加即可,且每一項的份量由其樣本數與分布自動決定。
下方標出最實際的差別 :右側的最大值附近有曲率,故給得出區間;左側沒有。
二、生成模型:從參數到計數
似然的三項各自對應一條由參數到觀測的路徑。
把三條路徑攤開,即為下圖的五層 —— 每一層只做一件事,
且除了第四層之外,中間沒有自由參數 。
生成模型:從一個純度到三個通道的觀測計數
五層由上而下,每一層只做一件事。
第一層是全樣本唯一的細胞比例,整份檢體只有這一個數。
第二層是每一個拷貝數區段的兩個整數,也就是兩條單倍型各有幾份,
它們是自由參數,但只能取整數。
第三層把前兩層換算成這個區段的分子組成:
每個腫瘤細胞按它的拷貝數貢獻,每個正常細胞在兩條單倍型上各貢獻一份,
所以兩條單倍型的分子數分別是細胞比例乘以拷貝數再加上一減細胞比例。
這一層沒有自由參數,它完全由上面兩層決定。
第四層是三個觀測通道,各自從第三層抽樣:
總深度比量整個視窗,用負二項;
單倍型深度比量生殖系異型合子位點,用貝他二項;
單倍型內體細胞佔比量體細胞位點,也用貝他二項。
所有的干擾參數都在這一層進入,包括帶原細胞比例、多重度、標記錯誤率與偵測機率,
前三層完全沒有這些東西。
第五層是實際數到的計數,也就是似然真正對上的資料。
右側是導出量:倍體是第二層各段拷貝數以可呼叫長度加權的平均,
腫瘤 DNA 比例再由倍體與第一層的細胞比例算出。
兩者都不是自由參數,所以它們的誤差可以一路追回到第一層與第二層。
讀法是:要判斷一個估計值可不可信,就看它依賴的是哪幾層。
生成模型:一個純度 → 每段拷貝數 → 分子組成 → 三個通道 → 計數
五層由上而下,每一層只做一件事。干擾參數全部集中在第四層 ,前三層沒有。
① 全域參數
全樣本唯一,不隨區段變動
p
cellular purity
② 每段參數
自由參數,惟須為整數
n₁
n₂
每個拷貝數區段一組
③ 分子組成
由上兩層決定
此層無自由參數
M₁ = p·n₁ + (1−p)
M₂ = p·n₂ + (1−p)
深色為腫瘤細胞的貢獻,淺色為正常細胞的一份
④ 三個觀測通道
干擾參數全部在此進入
總深度比
量:整個視窗
負二項
離散度、GC 偏差
單倍型深度比
量:germline het 位點
beta-binomial
參考偏差、標記錯誤
單倍型內 somatic 佔比
量:somatic 位點
beta-binomial
c、μ、標記錯誤、偵測機率
⑤ 觀測計數
似然真正對上的資料
視窗深度 列和 四格表
後兩者目前尚未彙總
導出量
不是自由參數
κ
②各段以長度加權平均
f
由 κ 與 ① 算出
為何要分層
一個估計值可不可信,
取決於它依賴到第幾層。
① ② ③ 只有整數與比例,
錯了看得出來。
④ 的參數需另行校準。
現行流程只用第④層最左邊那一格的一部分,再把 GHIR 分布壓成兩個矩 —— ②③ 兩層整個沒有被寫出來 。
五層。第一層是全樣本唯一的純度;
第二層是每個拷貝數區段的兩個整數,它們決定第三層的分子組成 ——
腫瘤細胞按其拷貝數貢獻,正常細胞每條單倍型各一份。
第四層是三個觀測通道,各自從第三層抽樣,nuisance 參數全部在這一層進入 :
somatic 通道帶 c 、μ 、標記錯誤率與偵測機率。
第五層是實際數到的計數。右側為導出量:倍體是第二層的加權平均,
DNA 比例再由它與第一層算出。倍體與 DNA 比例都不是自由參數。
第三層:分子組成
一個區段上,每個腫瘤細胞在單倍型 1 貢獻 n 1 份、單倍型 2 貢獻 n 2 份;
每個正常細胞各貢獻 1 份。故該區段的分子組成為:
M 1 = p · n 1 + ( 1 − p ) , M 2 = p · n 2 + ( 1 − p ) 此為中篇三個通道期望值的共同來源 。三個通道的差別只在於它們從這兩個量的
哪一部分抽樣,以及抽樣時 somatic 等位如何切分 M 1 。
第四層:三個通道各自的分布
通道 量測位置 分布 此處進入的 nuisance
log L depth 視窗全體
負二項 (非卜瓦松 —— 深度有過離散)離散度、GC 與可對應性偏差
log L germline germline heterozygous 位點
beta-binomial (非二項 —— 參考偏差與標記誤差造成過離散)參考偏差、標記錯誤率、phase switch
log L somatic somatic 位點的四格表
beta-binomial ,成功率為 s i c i 、μ i 、標記錯誤率、偵測機率
同一條 read 上的多個位點不是獨立觀測
三個通道的分布若一律取二項,等於假設每個位點各自獨立。
但長讀的一條分子會跨越多個位點,其標記錯誤與家族誤標一次作用於整條分子 ,
使同一條 read 上的位點高度相關。
後果是有效樣本數被高估 ,區間因而過窄、
似然比檢定過度自信 —— 而這不會在點估計上顯現。
取 beta-binomial 是最低限度的處置;更完整的做法是以分子為單位建模,
如中篇所述的 multinomial 形式。
第五層:四格表
中篇已指出現行的五個計數是 read 層級的標籤,不能直接相除。
本層所需的是每個 somatic 位點的四格表 —— 每條覆蓋該位點的 read 同時給出
「來自哪一條單倍型」與「在此位置是 REF 還是 ALT」:
read 的單倍型來源 在 i 為 REF 在 i 為 ALT
單倍型 1 R 1, ref R 1, alt
單倍型 2 R 2, ref R 2, alt
此表同時餵三件事 :列和給出單倍型深度比(通道一)、
第一列的內部比值給出 s i (通道三)、
而 R 2, alt 一格若非零,即為標記錯誤或該變異並非單一單倍型所獨有的訊號。
現行實作沒有這張表,但其原料(variantsHP、tumorPosReadCorrBaseHP)已在管線裡。
三、分段與定向是兩件不同的工作
中篇曾以 phase blockphase block 一段可建立連續相位關係的區域。read 長度不足、缺少 informative heterozygous 位點或證據不一致時,可能形成不同 phase blocks。 A contiguous stretch over which phasing is consistent. It can break when reads are too short, informative heterozygous sites are absent or evidence conflicts. 完整條目 → 的 N50 與拷貝數區段的尺度相近為由,
主張可直接以 block 分段。該論證不成立 :尺度相近不蘊含斷點對應。
拷貝數邊界與相位區塊邊界不對齊,故分段與定向是兩件工作
上排是拷貝數的真實邊界,這一段染色體分成三個狀態。
中排是相位區塊的邊界,兩排的邊界刻意畫成不對齊。
圖上標出兩種錯配。
第一種是一個拷貝數斷點落在某個相位區塊的中間,
於是那個區塊橫跨兩個不同的拷貝數狀態,
它的兩個等位拷貝數就不是一組整數,三個通道會同時被扭曲。
第二種是同一個拷貝數狀態橫跨好幾個相位區塊,
而區塊之間的單倍型標號各自獨立決定,
所以不能把它們直接串成一條連續的軌道。
下排是正確的做法:先用深度與生殖系等位計數獨立分段,並納入結構變異的斷點,
得到的邊界與上排一致;相位區塊只在每個區段之內提供哪一條是哪一條的定向。
兩者回答的是不同的問題,一個決定邊界在哪,一個決定邊界之內兩條怎麼配對。
讀法是:N50 尺度相近不代表斷點對應,這兩件事不能互相代替。
分段與定向是兩件不同的工作
同一段染色體。上排為拷貝數的真實邊界,中排為相位區塊的邊界,兩者不對齊 。
拷貝數狀態
1 + 1
2 + 0
2 + 1
相位區塊
B1
B2
B3
B4
B5
錯配一:B2 橫跨兩個狀態
其 (n₁, n₂) 不是一組整數
錯配二:一個狀態橫跨 B4 B5
兩區塊的標號各自獨立
正解:兩件工作分開做
① 分段
依深度、germline 等位與結構變異斷點 —— 邊界與上排一致
② 定向
相位區塊只在每個區段之內 指出哪一條是 H1
兩者回答不同的問題:分段決定邊界在哪,定向決定邊界之內兩條怎麼配對 。N50 尺度相近不蘊含斷點對應。
上排為拷貝數的真實邊界,下排為相位區塊的邊界,兩者刻意畫成不對齊 。
中間標出兩種錯配:一個拷貝數斷點落在 block 之內(該 block 橫跨兩個狀態,
其 (n₁, n₂) 不是一組整數),
以及一個拷貝數狀態橫跨數個 block(相位標號在 block 之間各自獨立,故無法直接串起來)。
下方為正解 :以深度與等位獨立分段並納入結構變異斷點,
相位區塊只在每個區段之內 提供 H1/H2 的定向。
拷貝數分段 相位區塊
回答的問題 邊界在哪裡 邊界之內,兩條怎麼配對
依據 深度、germline 等位、結構變異斷點 germline heterozygous 位點的連鎖
混用的後果 block 橫跨兩個拷貝數狀態時,( n 1, n 2 ) 非整數,三個通道同時被扭曲
文獻補充:PURPLE 也將分段與平滑分開
PURPLE 將分段與平滑列為獨立步驟,其依據為深度、等位比例與結構變異支持,
而非相位長度。此處沿用同一個分工。
四、nuisance 參數:c 、μ 與兩種錯誤
中篇指出:c i 若為自由參數,則 s i = p · c i 對任何
p ≥ max i ( s i ) 皆可完美擬合,資料只給下界。
本節的處置是不把它們當自由參數,也不把它們固定 ,而是設先驗後積分掉。
P ( s i ∣ p , n 1 ) = ∑ μ i P ( μ i ∣ n 1 ) ∫ P ( c i ) · BetaBin ( R 1, alt ; R 1, · , s i ( p , n 1, c i , μ i ) , φ ) dc i μ i 為不超過 n 1 的正整數,故其和為有限項 ,可直接列舉。
c i 的先驗取自 subclone 的階層模型:一個由 clonal 尖峰與 subclonal 連續成分構成的混合。
兩個干擾參數的處置方式不同,以及三種做法給出的輸出
左邊說明兩個干擾參數為什麼要分開處理。
多重度是離散而且有上界的,它不能超過該單倍型的拷貝數,
所以可能的取值是一個有限的集合,直接逐一列舉即可。
帶原細胞比例是連續的,落在零到一之間,所以給它一個先驗再積分掉。
右邊比較三種做法在同一批觀測上的輸出。
把帶原細胞比例固定成一,得到一個過低的點估計,因為次群變異被當成主幹變異。
讓它完全自由,似然從觀測值的最大值開始一路向上都是平的,
任何更大的純度都能靠調小帶原細胞比例來擬合,所以只給得出一個下界。
給先驗之後,後驗有一個峰也有寬度。
三者的差別不只在中心位置,更在於它能不能給出區間。
讀法是:先驗沒有創造資料裡沒有的資訊,它只是把常識寫成可檢驗的形式,
而且後驗的寬度會誠實反映資料到底支持多少。
兩個干擾參數,兩種處置
左為處置方式,右為三種做法在同一批觀測上的輸出。
μ:離散且有界
不超過該單倍型的拷貝數
n₁ = 3 → μ ∈ {1,2,3}
→ 逐一列舉 ,和為有限項
c:連續
落於 0 與 1 之間
→ 給先驗後積分
三種做法的輸出
0
max(s)
1
純度 p
固定 c = 1
點估計,且過低
c 全自由:平坦,只給下界
設先驗:有峰,也有寬度
先驗沒有創造資料裡沒有的資訊 —— 樣本若無 clonal 變異,後驗會退回接近先驗,而這由寬度看得出來 。
兩個 nuisance 參數的處置方式不同。
μ 是離散且有界的(不超過該單倍型的拷貝數),故逐一列舉 ;
c 是連續的,故給先驗後積分。
右側對照三種做法在同一批觀測上的輸出:固定 c = 1 給出一個過低的點估計;
c 全自由 給出一條由 max(s) 起始、向上無界的平坦似然;
設先驗 給出一個有峰、有寬度的後驗 —— 三者的差別不在中心位置,在於它是否給得出區間。
此處要說清楚的是先驗承擔了什麼 :
它並未創造資料裡沒有的資訊,而是把「腫瘤含有一批 clonal 變異」這個生物學上的常識
寫成可檢驗的形式。若某個樣本實際上沒有 clonal 變異(例如極低純度導致 truncal 變異全數未被偵測),
後驗會退回接近先驗,而這一點可由後驗的寬度直接看出來 ——
這正是點估計做不到的事。
五、解決與未解決的不可辨識性
解決:無等位失衡時純度不可辨識
上篇第八節列出的第一項不可辨識為「全基因體皆為 1+1 時 ρ 不可辨識」。
此時深度與等位比例兩條軌道皆為常數,對純度零資訊;
ASCAT 將此類樣本標記為非異常並拒絕輸出,PURPLE 則轉用二倍體區段的 VAF 峰。
而此情形下 n 1 = 1 處處成立,somatic 通道仍然作用,
故 p 的後驗不會退化為平坦。此項不可辨識因而被解除 —— 但只是條件性的。
須同時成立的條件有四項,缺一則模型僅為部分可辨識 ,
後驗退回第四節所述的「由 max i ( s i ) 起始的下界」:
至少存在一個真正 truncal(c = 1 )的 somatic 變異;
該變異落在 n 1 = 1 的分層之內;
它被 caller 偵測到,且單倍型標記正確;
其觀測值未被抽樣雜訊推高(取極大值本身即為向上偏誤的估計量)。
四者皆非自動成立,且第三項在低純度時系統性變差(第六節第二列)。
因此輸出必須是後驗而非點估計 —— 條件不成立時,後驗的寬度會顯示出來,
點估計不會。
未解決:全基因體加倍
將上篇的格點變換施於 somatic 通道:( k , m ) = ( 2, 0 ) 時
n 1 → 2 n 1 ,而發生於加倍之前 的變異其 μ 亦隨之加倍。代入 s :
s ′ = ρ ′ · c · 2 μ ρ ′ · 2 n 1 + ( 1 − ρ ′ ) 以 ρ = 0.40 、n 1 = μ = 1 為例:原式 s = 0.400 ;
加倍後 ρ ′ = 0.25 、n 1 ′ = 2 、μ ′ = 2 ,代入仍得 s ′ = 0.400 。
錨在加倍變換下不變,故不能單獨破解加倍簡併。
可用以定下模式的證據有三類,但三者的作用方式不同 :
奇數的等位特異拷貝數 —— 只擋一個方向。 它使該解無法再對半 ,
但任何解皆可再加倍 :含奇數拷貝數的解,其加倍版本全為偶數,
且對深度與等位比例給出逐格相同的觀測。
故奇數只是把該解定為此族中最小 的一個;真正排除加倍解的是簡約先驗 ,不是資料。
加倍之後才發生的變異 —— 這一項才是資料證據。 其 μ 不隨拷貝數加倍,
故兩個模式對它預測不同的 s 。惟須另行判定該變異的發生時序。
樣本外的量測 :流式細胞術的 DNA 指數、核型或 FISH。
此錨解除兩種不可辨識,但未解除全基因體加倍
三欄,各是一種原本無法由深度與等位比例分辨的情形,以及本頁的錨對它做得到什麼。
左欄是整個基因體都沒有等位失衡的樣本。
這時深度比處處相同、等位比例處處是零點五,對細胞比例完全沒有資訊,
上篇的兩個方法一個拒絕輸出、一個改用二倍體區段的變異頻率。
但這種樣本每一段的單倍型都是一份,所以錨處處成立。
這一項因而解除,不過是有條件的:
得先有一個真正主幹的變異落在這一層、被偵測到、標記正確,而且沒有被雜訊推高。
中欄是錨本身的區域限制。
上篇那個錨的分母含另一條單倍型,所以只能用在拷貝數接近二的區域;
本頁的錨分母只有一條單倍型,異型合子性喪失與擴增區段都能用。這一項也解除。
右欄是全基因體加倍。
把拷貝數全部乘二,發生在加倍之前的變異其多重度也跟著乘二,
代進去之後錨的值一模一樣。所以這一項沒有解除,
仍然要靠簡約偏好或樣本外的量測;奇數拷貝數只能擋住「再對半」,擋不住「再加倍」。
讀法是:把做得到與做不到分開講,是這條路線能不能被採信的前提。
解除兩項,未解除一項
三種上篇所列的不可辨識,以及本頁的錨對各項的作用。
全基因體無等位失衡
深度比處處相同,
等位比例處處為 0.5。
上篇:一者拒絕輸出,
一者改用二倍體區段的 VAF。
此時 n₁ = 1 處處成立,
故 s = p · c
惟須有 truncal 變異,見下篇第五節。
條件性解除
錨的區域限制
上篇的錨分母含 n₂ ,
故只能用於拷貝數近 2 的區域。
而 LOH 與擴增區段
正是腫瘤最具資訊的部分。
本頁的錨分母只含一條,
s = p·cμ ÷ (p·n₁ + 1−p)
式中不含 n₂ ,故全基因體可用。
解除
全基因體加倍
拷貝數全部乘二時,
加倍前發生的變異其 μ 亦乘二。
代入後 ——
ρ = 0.40 → s = 0.400
ρ′ = 0.25 → s′ = 0.400
錨在此變換下不變 ,
仍須靠簡約偏好或樣本外量測。
未解除
可宣稱:純度的估計不再要求區段為二倍體 ;無等位失衡的樣本在條件成立時 亦可估計。
不可宣稱:解決了純度與倍體的簡併。把做得到與做不到分開講,是此路線能否被採信的前提。
三種不可辨識的處置對照。
左欄「全基因體無等位失衡」:兩條軌道皆為常數,但 n₁ = 1 處處成立,故錨仍給出純度 —— 解除 。
中欄「錨的區域限制」:s 的分母不含另一條單倍型,故 LOH 與擴增區段皆可用 —— 解除 。
右欄「全基因體加倍」:拷貝數與 multiplicity 一同加倍時 s 不變 —— 仍未解除 ,
須另以簡約先驗或樣本外量測處理。
輸出格式:加倍未定時保留兩個模式
上述三類證據皆不成立時,後驗為雙峰 。
此時回報單一組 ( p , κ ) 會把一個雙峰的後驗壓成一個看似確定的數字,
且兩個峰所對應的 κ 相差一倍 —— 這在臨床解讀上不是小差異。
加倍未定時的後驗是雙峰,壓成一個數字會丟掉什麼
三欄。
左欄是後驗的實況:兩個峰,一個在細胞比例零點四、倍體二,另一個在零點二五、倍體四。
兩者對深度與等位比例給出完全相同的期望值,所以資料無法分辨它們,
而且第五節已證明體細胞那個錨在加倍變換下也不變,所以它也分不出來。
中欄是常見的做法:取最高的那個峰,回報一組數字。
另一個峰連同它的機率一起消失,讀報告的人看不出這裡本來有兩個答案,
而兩個答案的倍體差了一倍。
右欄是本頁要求的輸出:兩個模式各自附上機率,
並列出三類可以用來定案的證據,以及它們在這個樣本上的狀態 ——
有沒有加倍之後才發生的變異、有沒有樣本外的量測,以及有沒有奇數的等位拷貝數 ——
最後這一項只能擋住「再對半」,擋不住「再加倍」,所以它靠的是簡約偏好而不是資料。
讀法是:把雙峰壓成一個數字,丟掉的不是精度,是「這裡還沒有定論」這件事。
加倍未定時的輸出格式
同一份資料。兩個模式對深度與等位比例給出相同 的期望值,體細胞錨亦不能分辨。
後驗的實況
0.25
0.40
純度 p
κ = 4.0
κ = 2.0
兩個峰
取最高峰回報一個數
0.40
純度 p
κ = 2.0
另一個峰
連同機率一起消失
倍體差一倍,看不出來
本頁要求的輸出
p 0.40 κ 2.0
機率 0.6
p 0.25 κ 4.0
機率 0.4
可用以定案的證據
· 加倍後才發生的變異
· 樣本外的量測
· 奇數拷貝數(僅擋對半)
本樣本:三者皆無
壓成一個數字所丟掉的不是精度,是「這裡還沒有定論」這件事 —— 而兩個模式的倍體相差一倍。
同一份資料的後驗。左為雙峰的實況:
兩個模式的 (p, κ) 分別為 (0.40, 2.0) 與 (0.25, 4.0) ,
兩者對深度與等位比例給出相同 的期望值。
中為「取最高峰回報一個數」的結果:另一個模式連同它的機率一併消失。
右為本頁要求的輸出:兩個模式各自附機率,並列出可用以定案的三類證據及其在本樣本上的狀態。
六、失效模式
失效 機制 處置
H3 與無 germline 錨的位點
無法歸屬單倍型的 somatic read 進不了四格表。原始文獻報告 H3 的 F1 為 0.746、recall 僅 0.596
單倍型繼承程序可救回一部分;救不回者應排除該位點,不得計為零
低 DNA 比例時的 recall 下降
somatic 標籤的 recall 在比例 0.2 時降至約 0.6,使 R 1, alt 被系統性低估,p 隨之低估
偵測機率須進入第四層的似然,並以有真值的資料集估計其對 VAF 與深度的依賴
取樣偏誤
somatic 位點由 caller 挑選,其靈敏度隨 VAF、深度、序列脈絡、平台與純度而變,
故納入模型的位點不是隨機樣本 ,而是偏向高 VAF 者
與上一列為同一組參數;僅把 H3 排除並不足夠 ,因為其缺失亦非隨機
subclonality
s = p · c ,單一位點分不開 p 與 c
第四節的先驗;並回報 s 的多峰結構,其本身即為 subclone 的訊號
標記錯誤與參考偏差
phase switch、reference bias 與 mapping bias 皆壓縮或扭曲等位失衡
分支專屬的靈敏度與偽陽性參數;R 2, alt 一格提供其就地估計
跨 phase block
H1/H2 的標號逐 block 獨立(M13 的重要區分 #13),故 ( n 1, n 2 ) 的配對 只在單一 block 內有定義
κ 不受影響(僅用 n 1 + n 2 );沿染色體的等位特異拷貝數軌道需跨 block 連結,此為硬上限
TINCTINC 腫瘤污染正常樣本 Tumour-in-normal contamination:配對正常樣本含有腫瘤來源訊號,使 genuine somatic 變異也可能在 normal 中被觀察到,因而可能被錯誤過濾。 Tumour-in-normal contamination: tumour cells present in the matched normal, causing true somatic variants to produce signal there as well. 完整條目 →
正常樣本內含腫瘤時,正常側的深度正規化與濾波門檻皆偏移
現行的正常樣本 VAF 門檻處理其一;對本模型的影響須另行評估
哪些 somatic 位點無法貢獻單倍型內的佔比
上排是可用的情形:體細胞變異位點附近有生殖系異型合子位點,
而且同一條分子同時覆蓋兩者,
所以這條分子能被追溯到哪一條單倍型,可以進到體細胞子單倍型那一堆。
下排是三種不可用的情形。
第一種是附近沒有生殖系異型合子位點,分子上只有體細胞等位,無從歸屬。
第二種是分子太短,只蓋到體細胞變異而蓋不到旁邊的生殖系位點。
第三種是兩個位點落在不同的相位區塊,區塊之間的標號各自獨立,
所以就算兩個都蓋到,也不能把它們接起來。
三種都使該分子被標成無法歸屬。
最下面是一句必須遵守的規則:
這些位點應該整個排除,不可以把它們當成零計進分母裡,
因為那會讓分子偏小,細胞比例被系統性低估。
讀法是:可用的位點少,是這條路線的成本;把不可用的當成零,是錯誤。
哪些 somatic 位點無法貢獻 s
上排為可用者,下排為三種不可用者。實心圓為 somatic 位點,空心圓為 germline heterozygous 位點。
可用
read 同時覆蓋
兩類位點
可追溯至單倍型 → 進入 H1-1
不可用
① 附近無錨
分子上只有 somatic 等位
② read 過短
蓋不到旁邊的 germline 位點
③ 跨 phase block
▮
兩區塊的標號各自獨立,不可接續
三者皆使該分子被標為無法歸屬。此類位點須整個排除,不可計為零 —— 計為零會使分子偏小,純度被系統性低估。
哪些 somatic 位點無法貢獻四格表的第一列。
上排為可用者:該位點附近有 germline heterozygous 位點,且 read 同時覆蓋兩者。
下排為三類不可用者:附近無 germline 錨、read 過短無法同時覆蓋、
以及位於 phase block 邊界。三者皆使 read 落入 H3。
這些位點不得計入分母而以零充數 —— 那會使純度被系統性低估。
七、與現行方法的對照
與現行迴歸:同一條資料路線之內
項目 現行:兩個矩加多項式迴歸 本頁的規格
輸出 f 一個純量p 、κ 、每段 ( n 1, n 2 ) ,f 為導出量
係數來源 由合成混合樣本擬合而得 不需純度迴歸 的監督式訓練;式中的量皆有物理意義。惟偵測機率、標記錯誤率與平台校準參數仍須估計
跨平台 ONT 訓練、PacBio 直接轉移(原始文獻已驗證可行)
不含平台特定的迴歸係數 ;惟錯誤率、標記正確率與偵測機率仍須逐平台校準
—— 「不需訓練係數」不等於「平台無關」
深度依賴 折疊偏移進入兩個特徵,故隱含於係數之中 折疊可顯式建模為二項分布
不確定性 無 後驗給出區間;加倍未定時給出兩個模式
拷貝數變異與 LOH 視為干擾,以「經驗上穩健」處理 顯式建模,成為輸出的一部分
已驗證程度 8 個 ONT 與 6 個 PacBio 資料集,MAE 0.03 尚未執行
末列是本頁最重要的一列。上表前六列是設計目標 ,不是已達成的狀態;
現行迴歸在 f 上的成績已相當好,本規格在該項上不見得更好 ,
且多出的參數會帶來額外的估計誤差。
可宣稱的論據限於三項:把兩種成因分開量測 、多輸出三個量 、
以及失效模式可診斷 ;不可 宣稱精度改善。
與 ASCAT/PURPLE:真正的對照基準
現行迴歸不是唯一的比較對象,甚至不是最重要的那一個。
上篇所述的 ASCAT 與 PURPLE 是這個問題的既有標準,
而本規格的三個通道有兩個與它們重疊 —— 總深度與等位比例 ——
所用的代數也是同一套。因此差異必須逐項指出,不能以「資料型態不同」帶過。
項目 ASCAT PURPLE 本頁規格
等位訊號
germline heterozygous 位點的 BAF,刻意不做相位 ,A/B 標號隨機化,軌道對稱於 0.5
AMBER 取兩者較大值,值域 [ 0.5 , 1 ]
覆蓋該位點的 read 已帶單倍型標籤,故 phase block 之內不需折疊
折疊偏移
逐位點折疊後再分段
以二項分布算出平衡區段的期望值,觀測低於 0.535 時比較兩種解釋
折疊前的聚合單位由一個位點 放大為一個 phase block ,偏移隨區塊內總計數下降
somatic 通道
不使用
兩用:低純度解的懲罰,以及高度二倍體樣本的 VAF 退路(限推得拷貝數 1.8–2.2)
與另兩者同級的似然項 ;統計量為 s ,分母不含 n 2 ,故不需該區域限制
分段
等位特異的分段(ASPCF),深度與等位聯合
深度、等位與結構變異斷點
同 PURPLE 的三項依據 —— 此為沿用,不是新增
加倍簡併的處置
硬性倍體界限;四道條件皆不通過即回傳 NA
連續的事件懲罰,加上一條來自 somatic 的約束
不選解 :兩個模式各自附機率一併輸出
不確定性
點估計,或 NA
已輸出 minPurity/maxPurity(來自分數曲面)
後驗區間。差別不在「有沒有」,而在它是似然而非分數 ,因而可回報多峰
subclonality
嚴格 clonal
允許非整數拷貝數,但擬合中無混合模型
c 顯式建模並給先驗;s 的多峰結構本身即訊號
輸入需求
陣列或短讀;標準用法為配對正常樣本
短讀全基因體;另有 tumor-only 模式
長讀,且需可用的相位區塊 —— 短讀資料上不適用
已驗證程度
原始文獻 79 例,其後為泛癌標準工具
逾兩千例轉移性全基因體隊列
尚未執行
四個方法各自使用哪些觀測統計量
把 ASCAT、PURPLE、現行迴歸與本頁規格放在同一張表上,
每一列是一個可以從資料算出來的統計量,每一欄是一個方法,
格子填色代表該方法有用這個量,虛線代表沒有用,橘框代表有條件地用。
看下來會發現重疊的部分比想像中多:總深度比、逐位點折疊的等位比例、
結構變異斷點,這三個量 ASCAT 或 PURPLE 至少有一個已經在用。
真正只有本頁規格在用的是兩列:相位後不折疊的單倍型深度比,
以及分母只涵蓋一條單倍型的體細胞佔比。
現行迴歸所用的 GHIR 也自成一列,它量在體細胞位點上,
但分母涵蓋兩條單倍型而且經過折疊,所以跟上面兩個新增的量都不同。
PURPLE 的體細胞 VAF 那一格是橘框,因為它只在推得拷貝數落於
一點八到二點二之間時才啟用。
讀法是:要說明新意在哪裡,指的應該是那兩列,而不是整張表。
四個方法用到哪些觀測統計量
填色=使用,虛線=不使用,橘框=有條件使用。
ASCAT
PURPLE
現行迴歸
本頁規格
總深度比:視窗全體
BAF(germline 位點,逐位點折疊)
單倍型深度比(germline 位點,不折疊)
somatic VAF:分母涵蓋兩條單倍型
限 CN 1.8–2.2
GHIR:somatic 位點,分母兩條且折疊
單倍型內佔比 s:分母只有一條
結構變異斷點(供分段)
第 3 與第 6 列是本規格唯一新增的兩個量 —— 其餘五列 ASCAT 或 PURPLE 已在用。
每一列是一個可由資料算出的統計量,每一欄是一個方法。
填色為使用、虛線為不使用、橘框為有條件使用。
重疊的部分比預期多:總深度、逐位點折疊的等位比例與結構變異斷點,
ASCAT 或 PURPLE 至少有一個已經在用 。
只有第三列(相位後不折疊的單倍型深度比)與第六列(分母只涵蓋一條的 s )是新增的。
現行迴歸的 GHIR 自成一列 —— 它量在 somatic 位點上,但分母涵蓋兩條且經過折疊,
故與新增的兩者皆不同。
三項可宣稱的新意,與三項不是新意的事
上表的重疊處提示了一件事:把「換一種資料重做同一件事」講成「解決了別人解不了的問題」,
是最容易犯的錯。以下逐項界定。
① 相位由分子本身給出。
ASCAT 與 PURPLE 的等位軌道都是折疊的,其代價已在中篇量化:深度 20 時折疊偏移為 0.088,
大於 p = 0.20 二倍體位點的整段訊號 0.056。
須註明的是兩者對此的處置並不相同 :PURPLE 以二項分布明確校正(0.535 的比較),ASCAT 則無此步驟。
單倍型標籤使折疊前的聚合單位由一個位點放大為一個 phase block,
偏移隨區塊內的總計數而非單位點深度下降。
邊界 :這是量的改變,不是質的消除 。區塊之間的 H1/H2 標號仍然任意(第六節),
跨區塊連結是未解問題;而相位輔助的等位失衡估計本身並不新 ——
Battenberg 早以參考面板 imputation 達成同一方向的效果。
② germline 錨與 somatic 位點落在同一條分子上。
這是短讀與陣列做不到 的一件事,也是三項之中唯一長讀獨有者:
參考面板可以把 germline 位點相位化,但 somatic 變異不在任何面板裡 ,
面板 imputation 因此推不出四格表。四格表使 somatic 通道的統計量由 VAF(分母兩條單倍型)
變為 s (分母一條),PURPLE 的拷貝數 1.8–2.2 區域限制隨之不再需要。
邊界 :s 只消去 n 2 ,仍依賴 n 1 、c 與 μ (中篇第五節);
且它取代的是 PURPLE 的退路 ,不是其主要擬合。
③ 三個通道進同一個似然,共用一個 p 。
PURPLE 的 somatic 輸入是懲罰項與退路,不是帶自身抽樣模型的似然項;
本規格把它升格為與另兩者同級的一項。
邊界 :「有不確定性」不是新的 —— PURPLE 已輸出 minPurity/maxPurity。
新的是它是似然而非分數,因而可回報多峰 而非單一區間;
而此優點以模型正確為前提,模型錯時區間會過窄。
三項可宣稱的新意及其邊界,與三項早已存在的技術
左欄是本頁規格真正新增的三件事,每一件都附上它的邊界。
第一件是相位由分子本身給出,所以折疊之前的聚合單位從單一個位點放大到整個相位區塊;
它的邊界是區塊之間的單倍型標號仍然任意,跨區塊連結沒有解決。
第二件是兩類位點落在同一條分子上,四格表因而存在,
體細胞佔比的分母只涵蓋一條單倍型;它的邊界是這只消去另一條的拷貝數,
仍然依賴帶有變異那一條的拷貝數、帶原細胞比例與多重度。
第三件是三個通道進同一個似然,因而可以回報多個模式而不是一個區間;
它的邊界是這以模型正確為前提,模型錯的時候區間會過窄。
右欄是三件早已存在的技術,列出來是為了避免把它們算成新意:
純度與倍體的聯合網格擬合在 ASCAT 就有,
體細胞變異當純度錨是 PURPLE 的做法,
而用相位輔助等位失衡估計,Battenberg 以參考面板 imputation 早已做到。
讀法是:三件新增的事情裡,只有第二件是長讀獨有的,
因為體細胞變異不在任何參考面板裡,面板 imputation 相位不出四格表。
哪些是新的,哪些不是
左為本規格新增者,每項附其邊界;右為既有技術與其出處。
新增(各附邊界)
既有技術(出處)
① 相位由分子本身給出
折疊前的聚合單位:一個位點 → 一個 phase block
邊界:區塊之間的 H1/H2 標號仍然任意
② 兩類位點在同一條分子上
四格表因而存在:s 的分母只有一條單倍型
邊界:只消去 n₂,仍依賴 n₁、c 與 μ
③ 三個通道進同一個似然
可回報多個模式,而非一個區間
邊界:以模型正確為前提,模型錯時區間過窄
純度與倍體的聯合網格擬合
ASCAT 已有;PURPLE 用同一組代數
somatic 變異作為純度錨
PURPLE 的低純度懲罰與二倍體退路
相位輔助的等位失衡估計
Battenberg:參考面板 imputation
只有 ② 是長讀獨有的:somatic 變異不在任何參考面板裡,面板相位推不出四格表。
左為三項新增,每項附其邊界;右為三項既有技術及其出處。
把右欄寫出來的理由是:純度與倍體的聯合網格擬合、somatic 變異當純度錨、
相位輔助的等位失衡估計,三者都已有人做過 。
底列為結論 —— 只有第二項是長讀獨有的。
不可宣稱「取代 ASCAT/PURPLE」
三項限制同時成立:其一,本規格需要長讀與可用的相位區塊 ,
在短讀與陣列資料上不適用,故它不是同一個生態位的替代品;
其二,它尚未執行任何驗證 ,而對照的兩者各有 79 例與逾兩千例的紀錄;
其三,上表九列之中,資訊上真正新增的只有兩個統計量 ,其餘皆為既有技術的重新組合。
可宣稱的是一句範圍明確的話:在長讀資料上,somatic 錨不再受拷貝數區域限制,
且輸出多一組 ( n 1, n 2 ) 軌道與一組區間。
中篇的警告在此同樣適用 —— LOH 對 ASCAT 與 PURPLE 的主要擬合並非不利,
不可 宣稱「在它們失效之處仍然可用」。
八、實作分期
四個缺口彼此有依賴關係,故順序不是任意的。
在四格表建起來之前擬合整個模型,殘差無法歸因;
在無雜訊式子未經模擬驗證之前談效能,量到的是實作錯誤而非方法極限。
期 內容 此期可單獨驗證什麼
一 位點層級四格表;以深度與等位獨立分段(納入結構變異斷點)
計數正確性。不涉及任何模型選擇,可與既有 caller 的 VAF 逐位點對帳
二 以模擬計數反解無雜訊式子
實作錯誤 。由已知的 ( p , n 1, n 2, c , μ ) 生成計數,確認可反解回原值;此期失敗與方法無關
三 階層式似然:三個通道加 c 、μ 、標記錯誤與偵測機率的先驗
收斂性與初始值敏感度;後驗區間的涵蓋率
四 加倍未定時輸出多個模式 模式判定的正確率
五 掃參數空間的模擬:純度、倍體、加倍時序、subclonal 拷貝數變異、突變負荷、phase switch 錯誤率、深度、讀長、TINCTINC 腫瘤污染正常樣本 Tumour-in-normal contamination:配對正常樣本含有腫瘤來源訊號,使 genuine somatic 變異也可能在 normal 中被觀察到,因而可能被錯誤過濾。 Tumour-in-normal contamination: tumour cells present in the matched normal, causing true somatic variants to produce signal there as well. 完整條目 → 、兩個平台
失效邊界的位置
完整流程:現行實作已具備的四步與須新增的四步
八個步驟由上而下。
淺色的四步是現行實作已經做完的:
把腫瘤與正常配對資料的分子標上單倍型;
在每個體細胞變異位點上算出五個計數;
用四道濾波把低信心的變異去掉;
以及相位區塊,它提供每個區段之內兩條單倍型的定向。
深色的四步是要新增的:
以深度與生殖系等位計數獨立分段並納入結構變異斷點,因為拷貝數斷點不一定落在相位區塊的邊界上;
在生殖系異型合子位點上算單倍型深度比,這是目前完全沒有用到的通道;
彙總每個位點的四格表,算出單倍型內的體細胞佔比 ——
現有的五個計數是每條分子一個標籤,不是每個位點的等位計數,所以不能直接相除;
依每段的拷貝數把這些位點分層,再一起最佳化細胞比例與各段的拷貝數;
最後輸出四個量以及各自的區間。
右邊標出被取代的部分:現行流程在算完五個計數之後,
取分布的中位數與四分位距,再用迴歸換成一個純量,這整段被取代掉。
讀法是:新增的工作集中在後半,前半的原料已經在了。
完整流程
淺色為現行實作已具備者,深色為須新增者。右側為被取代的部分。
已具備
① 對腫瘤與正常配對資料進行單倍型標記
② 每個 somatic 位點的五個計數
③ 四道低信心變異濾波
④ phase block:提供區段內的 H1/H2 定向
須新增
⑤ 以深度與等位獨立分段(納入 SV 斷點)
⑥ 位點層級四格表 → 單倍型內 somatic 佔比
⑦ 依 n₁ 分層,聯合最佳化 p 與各段拷貝數
⑧ 輸出 p、κ、各段拷貝數、f 及其區間
被取代的部分
取 GHIR 分布的中位數與四分位距
以二階多項式迴歸換為一個純量
輸出只有 f,且係數需訓練
新增工作的性質
⑤ 需重新掃一次 germline VCF,
但標記結果已在 BAM 上
⑥ 須新增位點層級的彙總
⑦ 為本路線的主要新增工作,
其收斂性尚待模擬檢驗
完整流程。淺色的四步為現行實作已具備者:
單倍型標記、五個計數、低信心變異濾除,以及提供區段內定向的 phase block。
深色的四步為新增者:以深度與等位獨立分段、位點層級四格表、
依 n₁ 分層的聯合最佳化,以及輸出四個量與其區間。
現行的「兩個矩加迴歸」被整段取代。
真實資料與證據
真值缺口
合成混合樣本依 read 比例混合,其所控制的量是分子比例 f 。
本規格的主要輸出為 p 與 κ ,而這兩者在此資料上沒有乾淨的真值 。
由 f 反推 p 需要來源細胞株的倍體。以標示為 0.2 的混合樣本為例:
來源細胞株的 κ 2.0 3.2 4.0
f = 0.20 所對應的 p 0.200 0.135 0.111
重要區分 #18:合成混合的已知比例是 DNA 比例,不是細胞比例
以 read 抽樣後合併所合成的樣本,其已知的比例是分子 的比例 f 。
M8 已建立 f 與 cellular purity p 在非二倍體之下並不相等(重要區分 #2);
此處是該項在實驗設計 上的後果。
可容許之處 :以此資料評比一個輸出 f 的方法完全恰當,
真值精確且無須換算。現行的評比即屬此類。
限制 :以同一批資料評比一個輸出 p 的方法時,
須先將標示值換算為 p ,而該換算需要來源細胞株的倍體。
若逕以標示的 0.2 當作 p 的真值,會改變方法之間的排名 ——
誤差是到參考值的距離,換掉參考值不是對所有估計值施加同一個平移,
故估得偏高、恰好接近 f 的方法會被系統性地評為較佳。
三條分開的評比軌道
因此驗證設計不能只有一張表。三個量的真值強度不同,須分開報告:
三條分開的評比軌道,各自的真值強度不同
三欄,各是一條評比軌道。
左欄是腫瘤 DNA 比例。它的真值就是混合時所用的比例,精確而且不需換算,
所以這一條可以跟現行的迴歸直接比較,
也是唯一一條能夠宣稱優於現行方法的軌道。
中欄是細胞比例與倍體。合成樣本沒有這兩個量的乾淨真值,
要取得就得另外做流式細胞術、DNA 指數、核型或螢光原位雜交,
而這些本身也帶不確定性。
所以這一條只能宣稱與其他方法一致,不能宣稱準確。
另一個可行的檢驗是自洽性:把估出來的細胞比例與倍體換算回腫瘤 DNA 比例,
再跟已知的混合比例對照。
右欄是校準度,包括區間的涵蓋率、失敗率,以及加倍模式判定的正確率。
這一條完全不需要外部真值,但它也完全不在平均絕對誤差與決定係數的涵蓋範圍內。
而它才是「這個數字可不可以拿去用」的依據。
讀法是:三條軌道不能混在同一張表裡報告,因為它們可宣稱的強度不同。
三條軌道要分開報告
三個量的真值強度不同,混在同一張表裡會讓最弱的一條借用到最強的一條的可信度。
腫瘤 DNA 比例 f
真值:混合比例,精確
不需換算,直接可比。
與現行迴歸同一個量。
可宣稱:
優於現行方法
唯一能這樣宣稱的一條
細胞比例 p 與倍體 κ
無乾淨真值
須另做流式細胞術、DNA 指數、
核型或 FISH,且皆帶不確定性。
或檢驗自洽性:由估得的兩者
換算回 f,與混合比例對照。
可宣稱:
一致,但非準確
校準度
不需外部真值
· 區間涵蓋率
· 失敗率
· 加倍模式的正確率
· 跨 basecaller 的重現性
MAE 與 R² 不涵蓋這一條
但它決定能否使用
混在同一張表裡報告,會讓最弱的一條借用到最強的一條的可信度 —— 讀者以為 p 也有 MAE 0.03 那種等級的驗證。
而此主題最欠缺的正是金標準,故第三條軌道的份量比一般情形更重。
三條軌道各有不同的真值來源與可宣稱的強度。
左:f 有精確真值(混合比例即為之),可與現行迴歸直接比較,
這是唯一能宣稱「優於現行方法」的軌道 。
中:p 與 κ 沒有乾淨真值,
只能與另有佐證的樣本比對,或檢驗自洽性 —— 由估得的兩者換算回 f ,與已知混合比例對照。
右:校準度(區間涵蓋率、失敗率、加倍模式正確率)完全不在 MAE 與 R² 的涵蓋範圍內 ,
但它才是「這個數字可不可以拿去用」的依據。
軌道 真值來源 可宣稱什麼
f 混合比例,精確 與現行迴歸的直接比較
( p , κ ) 流式細胞術、DNA 指數、核型或 FISH;皆須另行取得且帶不確定性
僅能宣稱一致性,不能宣稱準確度
校準度 不需外部真值 區間涵蓋率、失敗率、加倍模式正確率
第三條軌道不需要金標準 ,而金標準正是此主題最欠缺的條件。
同一細胞株在不同 basecaller、不同機構之間的重現性亦屬此類。
預測與結果檢視
一份合成混合樣本標示為「purity 0.2」,
其來源細胞株的倍體為 3.2。某方法在此樣本上估得 cellular purity 為 0.14,
另一方法估得 0.18。哪一個比較準?
展開答案 0.14,而且用錯參考值會得到相反的答案。
該樣本以 read 比例合成,故標示的 0.2 是分子比例 f 。對應的 cellular purity 為
p = 2 f κ ( 1 − f ) + 2 f = 2 × 0.20 3.2 × 0.80 + 0.40 = 0.135
估計值 對真值 p = 0.135 的誤差 對標示值 0.20 的誤差
0.14 0.005 (較佳)0.060
0.18 0.045 0.020 (較佳)
排名反轉。 常見的誤解是「這個偏誤作用於所有受測方法,故排名不受影響」——
該說法不成立,因為誤差是到參考值的距離 ,換掉參考值並非對所有估計值施加同一個平移。
其方向亦值得留意:用錯參考值的評比會系統性地偏好那些估得偏高 、
恰好接近 f 的方法 —— 也就是偏好把 DNA 比例當純度回報的方法 。
此偏誤不會在任何內部一致性檢查中顯現。
尚未解決的問題
整條規格尚未執行。 上述各項皆有代數上的依據,但均未在真實或模擬資料上檢驗。
最小的驗證為第八節第二期:由已知參數生成計數,確認可反解回原值。
分層與估計互為前提。 s 的分層需要可靠的每段 ( n 1, n 2 ) ,
而後者正是要一併估計的量。此為典型的交替最佳化問題,
其收斂性與初始值敏感度未知 。
偵測機率的形式未定。 它至少依賴 VAF、深度與序列脈絡,
但其函數形式須由有真值的資料集估計,而該資料集目前僅有 HCC1395 一株。
c i 先驗的來源。 本頁取自 subclone 的階層模型,
而該模型在本教材的另一個主題中本身也是待建立的對象 ;
兩處若各自選定不同的先驗,得到的 p 會不一致。
p 與 κ 沒有乾淨的真值。 三條軌道皆為間接,
且此條件不因方法改良而改善。
與 subclone 重建共用 c 。 兩處的估計理應一致,
目前各自獨立、未曾互相檢驗 —— 而互相檢驗本身即為一項不需金標準的驗證。
原始文獻與程式碼
本頁的計數定義與各項閉式,均以 LongPhase-S 的原始碼為準:
GHIR 的定義見 src/haplotag/HaplotagStrategy.h 的
calculateHaplotypeImbalanceRatio;
五個計數與其填入條件(含 hpResult 為 read 層級標籤一事)見
src/somatic_haplotag/SomaticVarCaller.cpp;
低信心變異濾波與現行的迴歸流程見
src/somatic_haplotag/TumorPurityEstimator.cpp。
程式碼在 github.com/CCU-Bioinformatics-Lab/longphase-s ,
方法與實測數值見其預印本
(bioRxiv, 2025,doi 10.1101/2025.11.20.689492 )。
第一節的似然形式、第三節的分段分工與第五節的格點變換,
其出處、常數與程式碼位置均列於上篇的同名節次,此處不重複。
負二項與 beta-binomial 在定序計數上的適用性為標準結果,
可見於任何一本計數資料迴歸的教科書。
本模組術語 TINC(腫瘤污染正常樣本) Tumour-in-normal contamination:配對正常樣本含有腫瘤來源訊號,使 genuine somatic 變異也可能在 normal 中被觀察到,因而可能被錯誤過濾。 phase block 一段可建立連續相位關係的區域。read 長度不足、缺少 informative heterozygous 位點或證據不一致時,可能形成不同 phase blocks。