解釋頁 06 · 方法構想 · 局部分子狀態候選 pipeline
ISM 怎麼系統化分析局部 mutation-state candidates?
把 chr2:18M 案例的 read-level 分析萃取成 9 步候選流程:建立局部 mutation states、標記 homopolymer artifact、描述分組後甲基關聯,並用 matched-normal screen 標記已偵測的 ASM confound。它不能把 screen-negative 證成 acquired,也不是已實作或已驗證的 cellular-subclone 重建器。
L0 核心構想(B0)
在同一條長 read 上聯合觀測 candidate allele + haplotag + native 5mC,於 LOH-annotation-compatible + somatic-haplotag-conditioned 框架下,用多點 read linkage 定義 regional molecular-state candidates,再用 normal-anchored 甲基 screen標記既存 germline ASM confound → 輸出有不確定性的區域分子狀態 characterization(非 cellular clone / 完整 phylogeny)。SEQC2 註記與 HP imbalance 不等於 allele-specific CN 機制定案;甲基只作分組後 association,不建立 topology edge。
▸ 給教授一句話:這個 pipeline 不是「找到甲基差就宣稱 subclone」;它先用 read linkage 的互斥/共現建立候選分子狀態、用 homopolymer guard 擋定序假象,再用 matched-normal ASM screen區分「已偵測到既存 ASM」與「tumor-associated、normal-ASM-screen-negative 甲基關聯」。後者仍不證明 acquired 或 cellular subclone。
⚠ 定位:這是「構想基礎」,不是已交付的自動化模組
- 9 步流程目前是個案手做驗證可成立(chr2 單一區域案例含 6 sSNV + BRCA2 單 locus,L2);系統化(自動化 + 標準化判準)是 handoff B2 的目標,屬 future work。
- 每步的「判準/閾值」來自案例落地值(如互斥 0 個
11、cross-basecaller 過 FDR、pos4 20bp poly-T mask),可作標準化起點,但須跨樣本再校準。
① 9 步 pipeline 一圖看懂(四個階段)
輸入 → 局部 mutation states → 甲基關聯(含 ASM screen)→ 候選輸出。紅框 = 防呆護欄所在步驟。
圖 1 · regional molecular-state candidate 分析 pipeline(9 步 / 4 階段)
怎麼讀:四階段由左到右;步 4 / 步 6 是兩個關鍵護欄(紅框)— homopolymer guard 與 normal-HP ASM 控制。底部紅區 = 3 條防呆對應的步驟。來源:Part B B1/B2(20260615_chr2_subclone_case_and_method_concept_01.md)。
② 9 步的判準與護欄(B1)
每步附「案例落地的判準」與「護欄」。這是把個案手做變成可標準化判準的起點。
| 步 | 做什麼 | 判準 / 閾值(案例落地) | 護欄 |
| 1 | 萃取 read×sSNV×5mC 矩陣 | unique primary、MAPQ≥20、BQ≥10;MM/ML 解碼 5mC 映回 ref;數字先落 JSON | dedup(案例 340→280) |
| 2 | LOH context | SEQC2 LOH BED annotation + HP imbalance(案例 98.3%/99.6%);matched-normal ALT=0 | 只判 context-compatible;未整合 allele-specific CN,不能判 CN-loss vs cnLOH、機制或 retained parent |
| 3 | mutation-state linkage | 00/10/01/11,要求跨位點 read;0 observed 11 只支持互斥 compatibility pattern,共現支持同分子 state,但都須保留 coverage/error/recurrence 不確定性 | 跨距不足 → 關係標 UNRESOLVED |
| 4 🛡 | artifact guard | homopolymer context check(案例 pos4 C>G 為 truth-evaluable TP;鄰接 20bp poly-T 的 G/T/DEL 三態標 homopolymer-uncertain,不拆三群) | ONT homopolymer/strand-bias 必查;單 strand call 不算群 |
| 5 | 甲基判別 per allele anchor | Mann-Whitney + BH-FDR;要求 cross-basecaller 同方向 + 過 FDR | 單 basecaller n=1 不可解;distal 未複製 → 排除 |
| 6 🛡 | normal-HP ASM screen | normal HP1-vs-HP2 顯著者(案例 3.3/3.4/3.5/4.1)標 confounded;其餘稱 tumor-associated、normal-ASM-screen-negative | screen-negative 不證明 acquired/clone |
| 7 | tumor/normal differential cross-check | all-read tumor vs normal MW FDR;同方向跨 basecaller | all-read 差混 composition/LOH/ASM → 須 allele+normal-HP conditioned 再拆 |
| 8 | 建非時間 compatibility graph | read-level conditional pattern 只約束相容模型(案例 (3)/(5)),不確認方向或取得次序;無 direct bridge → block 關係保持 unresolved;甲基 association 不補 link、common node 或方向 | 共現/absence/VAF 均不可單獨判定 parent-child |
| 9 | 誠實 tier | regional molecular-state candidates;標 L2/單一區域案例;nesting 亦只支持 provisional model | 禁「confirmed N-subclone」 |
③ 三條防呆(B2)— 為什麼這 pipeline 不會重蹈覆轍
這三條正是 chr2 案例「早期過度宣稱」的根因;系統化時必須內建為硬性檢查。
防呆 1homopolymer artifact
variant 後接 homopolymer → 多 allele call(G/T/DEL)須標 homopolymer-uncertain,不能直接當多個 subclone。必查 context。
案例:pos4(18,096,269) 後接 20bp poly-T → 原「5 群」撤回。歷史 merge rule 所稱「約 3」只是 operational labels;block L/R unresolved,不是 biological lower bound、完整 candidate count 或 clone 數。
防呆 2VAF 不可排序 siblings
此區有 LOH annotation + HP imbalance,但 allele-specific CN、純度與機制未整合;局部 VAF 不可用來排 parent/child。nested read pattern 只能約束相容的局部模型,不能單獨確認方向或突變順序。
案例:pos5 局部 VAF 0.31 vs 全基因組 0.05 → VAF 排序撤回;(5)C 僅在帶 (3)A 的 shared-coverage reads 中出現,是無方向的 conditional containment pattern。
防呆 3coverage 假象
缺「跨多點 all-REF read」≠ ancestral allele 消失(read-length 限制);root 是 parsimony 推論非觀測。
案例:「無 ancestral REF read」撤回 — BQ20 all-REF local patterns 在 ≥2 點為 HKU 17 / DORADO 15,≥3 點為 HKU 4 / DORADO 0;這不證明已觀測祖先細胞,缺跨 ≥4 點仍是覆蓋限制。
④ ASM 控制 = ISM 對此案例的關鍵方法增值(B3)
這是整個 pipeline 最重要的一步,也是 ISM 區別於「只 flag 甲基差」的工具的地方。
圖 2 · 為什麼需要 normal-anchored ASM 控制
怎麼讀:SEQC2 LOH annotation + HP imbalance 只界定相容 context;沒有 allele-specific CN,不能推導 CN-loss、cnLOH、事件機制或 parental-copy retention。matched-normal HP1-vs-HP2 screen 可標出已偵測的 ASM confound;screen 陰性仍不證明甲基化為後天取得或 cellular-subclone-specific,且甲基不能橋接 topology edge。來源:Part B B3 + Part A A5(ASM-control 表,引自 independent_audit.md)。
核心訊息(這就是研究的方法價值):此區同時有 normal haplotype ASM 與 tumor-associated 甲基關聯 — ISM 的價值是用 matched-normal 標記已偵測的 ASM confound,而非把所有甲基差都歸 subclone。normal-ASM-screen-negative 子集與遺傳分組相容,但不證明甲基化是後天取得或來自某個 cellular subclone。
⑤ 從個案到系統化(B4)— 升 validated 的關鍵路徑
目前是個案手做 L2;要升 validated 需要把 9 步自動化 + 標準化判準 + 跨樣本複製。
現況 → 目標
現在:個案手做 L2(chr2 單一區域案例含 6 sSNV + BRCA2 單 locus)。升 validated 需:① B1 九步自動化成 ISM 模組(read→molecular-state assignment + ASM-control + non-temporal compatibility graph with unresolved relations);② 標準化判準(互斥閾值、FDR、cross-basecaller 複製、homopolymer mask、ASM-control gate);③ 第二 LOH 區域案例/第二樣本(破單一區域案例限制);④ 第二 caller/pipeline(破 DORADO=同細胞株技術重現非獨立病人)。
| handoff | 內容 | 狀態 |
| B2 | 個案 → 系統化 + 標準化判準(9 步自動化)= 主軸升 validated 關鍵 | future |
| B5 | within-HP null / ASM-control | 已部分跑 |
| B7 | 跨樣本複製 | ★4 目標 |
| B4 | 第二 caller(破同細胞株技術重現) | future |