解釋中心
解釋中心 · INDEX · 全站樞紐

InterSubMod 解釋中心

把各研究任務的敘述與邏輯,轉成分層、配圖、嚴謹定義的解釋頁,讓有實驗室背景的讀者全面理解。每個概念一頁,重點先行、細節折疊。這頁是入口與導覽。

L0 一眼看懂這個研究在做什麼

用 ONT 長讀在單一 read 上同時讀到 candidate somatic 突變 + 單倍型 + 甲基化,研究 LOH 如何重塑 haplotype 結構,並誠實界定甲基化可做的 characterization,以及已測 variant-filter formulation 的 negative evidence;materially new、經 audit 的假說仍可重開。

▸ 給 PI 一句話:目前證據包含對已測 formulation 的多個 convergent negative tests(甲基 filter)+ phasing 候選脊柱(Grade B+)+ ASM copy-confounded 支撐;不是不可推翻的 universal negative,也不建立 cellular clone truth。

● 讀本站的 4 條鐵則
  1. 「具名 scope 有 allele-associated methylation」≠「能判別 TP/FP」——兩個 claim 永遠分開講。
  2. HP-axis(HP1 vs HP1-1)是 project-specific somatic-conditioned comparison,可減少部分 context confound;ALLELE-axis(ALT vs REF)易混入 germline het baseline。兩者都不是 confound-free/causal 軸。
  3. 絕對 AUC 系統性膨脹(germline het null median 0.974);引相對 null(excess/delta)不引絕對 AUC。
  4. 甲基→TP/FP filter 的已測 formulation 為 concluded negative;重開須有 materially new hypothesis 與 pre-decision audit。同 haplotype 內 T3 亦只對已測設計為 negative。

建置進度

✓ INDEX(本頁) ✓ 背景名詞地基 ✓ ISM 方法本體 ✓ 甲基讀取與篩選 ✓ chr2:18M 局部分子狀態案例 ✓ chr2:18M 矯正 audit(權威裁決) ✓ ISM subclone pipeline 構想(9 步) ✓ 系統全景(架構 · 狀態 · funnel) ✓ ISM 部件 I/O ✓ LongLineage 部件 I/O ✓ 上游工具鏈與資料 ✓ 分析與呈現層 ✓ 操作手冊 ○ ism-vs-external ○ 四道 NEGATIVE ○ LOH-phasing 脊柱 ○ normal-anchored cis heuristic ○ methyl-phasing-assist ○ ASM 跨樣本 ○ ism-evolution

共用樣式 _assets/explain.css(改一處全站套用)· 名詞 SoT 01_background-glossary · 盤點底稿 _planning/00~04

▤ 系統架構與操作 2026-08-06 新增

上面的頁面講的是科學方法;這一組講的是系統本身 —— 有哪些部件、各自吃什麼吐什麼、現在哪些真的跑得動、以及怎麼動手跑。 給第一次接觸這套系統的人(指導教授、新進同學)看的。 每個部件標了狀態:可跑 有限制 被鎖住。

系統全景 先看這頁

五層架構圖、兩個 repo 的候選關係與 source-origin/license audit pending 邊界、誠實狀態表、7 technical datasets/6 biological IDs funnel、能與不能回答什麼。
▸ PI:技術層 technical_all_pass=true 但科學層 validation_evidence_eligible=false —— 系統在機器欄位層級就把「跑通」與「可用」分開。
看全景 →

InterSubMod 部件 可跑

3 個必填輸入、8 個內部階段、17 種輸出檔(附真實 header 與資料行)、3 條實跑驗證過的指令、9 條會靜默出錯的陷阱。
▸ 重點:tree.nwk 的葉子是 read 不是 clone;significance_summary.csv 欄數跨版本不一致,目前 199 欄含兩個元件 schema 版本,但仍沒有單一 whole-file layout version。
看 ISM 部件 →

LongLineage 部件 research preview · BLOCKED

4 個子命令的 revision-scoped 狀態、M1→M2→candidate topology 鏈、artifact 契約,以及 private candidate b9aaa12 的 frozen HCC1395 receipt(0 candidate units)。部分 kernels 曾由具名 dataset-gate 執行,不等於全部核心已驗證、production 可用或具 public 資格。
▸ 重點:P3/P4/P5/P7/P8 gates 尚未通過;blockers 並列包含 parity/validation、source-origin/license/dependency audit 與 release-safety,不可把「對照證據」稱為唯一 blocker。甲基化在該具名流程是總開關,83.9% 位點未產生配對;這也不構成 production 或 public PASS。
看 LL 部件 →

上游工具鏈與資料 7 technical datasets

Dorado / ClairS / LongPhase-S / SAVANA 各產生什麼、sidecar 格式、7 technical datasets/6 biological IDs 的實體資料、三個會讓你算錯數字的陷阱。
▸ 重點:FILTER 重校正是雙向的(救回 4,592、降級 5,528、淨 −936);HP 有字串與整數兩種型別,用錯 parser 會靜默丟資料。
看上游 →

分析與呈現層

實際會用到的 Python 腳本、工作站 HTML 對 spec-required fields 的「缺值拒絕渲染」設計,以及這層的四個坑;它不驗證來源真實、spec 完整或科學正確。
▸ 重點:182 支腳本硬編了另一個分支的 worktree 路徑;預設 python3 版本會讓部分腳本直接崩。
看分析層 →

操作手冊 可複製指令

從編譯到跑出第一個結果的 6 個步驟,每步附驗收條件與真實輸出;常見狀況排除表。
▸ 驗收:run_tests/CTest 的 test 與 suite count 由該 commit 實際輸出動態取得;要求 0 failure、exit 0,不手抄固定數字。單點 2.9 秒僅是具名內部 fixture 的歷史 receipt,不是一般 runtime。
照著跑 →

▦ 10 條研究線(一句話 + 給 PI 重點 + tier)

每條線一張卡。狀態色:方法 POSITIVE TESTED NEGATIVE 混合。

ISM 方法本體 ★3

讀 ONT 癌症 BAM,對每 somatic 位點做甲基矩陣→read-read 距離→algorithmic clustering→指定 label 的 PERMANOVA。量 read-distance/label association,非 filter、cluster truth 或 cellular group validation。
▸ PI:量 between-molecule 距離;project-specific normal-anchored cis heuristic 只標記 cis-compatible/copy-screen-negative candidate,不證明 copy/germline/drift 已移除。
方法本體 →  甲基讀取/篩選細節 →

背景名詞地基 地基

整個專案的「語言」:read / haplotype / HP-tag / 5mC / ASM / cis / Δβ / LOH / CN 等 28 核心詞 + 統計 worked example。
▸ PI:HP-axis vs ALLELE-axis、「scope-bound association≠判別」、excess-over-null 三個定義決定所有結論能否成立。
看這頁 →

methyl-phasing-assist 混合

研究假說:測試 read-level 甲基模式能否輔助 haplotype assignment;目前沒有已驗證的 per-read rescue/correct-tag truth(V1-V12)。
▸ PI:88.5% 僅屬模擬條件下的回推結果;94% 真實 unphase reads 落在 LOH/imprinting 等困難區,不能把模擬成功率外推為 production rescue。
關聯入度最高(7)· 建議樞紐起點
待建

ism-vs-external(軸 C vs 軸 A)★3

ISM 以指定 label 與 read-distance variation/centroid separation 的 association 為主問題(軸 C),而非只算「兩組率差」(軸 A);PERMANOVA 須合讀 PERMDISP,不能證明 unsupervised cluster truth。已測甲基 TP/FP formulation 的結果為 negative,不外推成 universal negative。
▸ PI:read-read 距離 + PERMANOVA + normal-anchored cis 是 project-specific proposed combination;novelty/priority 為 UNVERIFIED,待具日期的 systematic prior-art search 與 head-to-head comparison。
待建

四道 convergent negative tests(已測 filter formulation)★2 L4

用甲基特徵辨別 TP/FP 的已測 formulation 有多個 convergent negative tests;其 scope 與日期必須保留,不能寫成不可推翻的 universal negative。
▸ PI:pilot ΔF1=+0.00242 低於門檻 / LOSO 100% 循環 / 消融確認甲基是第 5 順位 vestigial。
待建

LOH-phasing 脊柱 B+ ★3

LOH 區突變留下「同單倍型分裂」phasing 特徵可與 germline FP 區分,但由 LOH 物理結構決定故帶 by-construction 循環。
▸ PI:LOH 內 NG=2 reads 93-99% same-hap(7/7 technical datasets;6 biological IDs,p=0.0078),但 self-ref 全基因組負控(~25-50hr)未跑 → Grade A 待決策。
待建

ASM ZAR1L/BRCA2 + 跨樣本 ★3

具名 BRCA2/ZAR1L scope 觀察到 allele-associated methylation 且有技術重現;這不證明 causal cis/tumor-acquired,而 association 與能否判別 TP/FP 也是兩件事——已測設計未形成判別器。
▸ PI:observed Δβ=−0.122、6/6 biological IDs excess>0 跨 3 癌種;但 strong-ASM 在 FP 富集 5×(OR=0.194)→ 已測設計未形成可用 filter。
待建

ASM cis + CN confound ★3

具名 scope 的 allele-associated methylation 未形成 TP/FP 判別;project-specific cis-compatible/copy-screen-negative heuristic 亦未改善已測判別,且 FP 較常符合該 heuristic。這不證明 causal cis 或 confound 已移除。
▸ PI:6 biological IDs、約 28 萬位點:TP association 顯著率 3.95% > FP 1.07%,但絕對靈敏度~4% / COLO829 TP≈FP。
待建

主軸:Subclonal Reconstruction 混合

ONT 單 read 同時讀 somatic + HP tag + 甲基,揭示 LOH 重塑 haplotype,誠實界定 characterization vs filter。
▸ PI:deliverable = 已測 formulation 的多個 convergent negative tests + 方向一致的跨樣本 phasing 訊號;脊柱 = genetic haplotagging。
待建(論文框架)

案例:chr2:18M 局部分子狀態候選 案例 L2

HCC1395 一段 LOH 區的 6 sSNV + 甲基逐步走查,展示「手動 IGV 直覺 → read-level 實測校正」。直接資料支持局部 mutation-state candidates 與分組後甲基關聯,不是已確認的 cellular clone 或 lineage tree。
▸ PI:LOH、mutation-marker 共現/互斥與部分 CpG 的跨 basecaller 技術重現獲觀察;歷史「約 3」只是特定 merge rule 的 operational labels,block 關係 unresolved,順序、完整 candidate count、clone 身分與 originating cell 皆不可由本案例確定。
先看為何可行(邏輯鏈) →  看案例走查 →  看權威 audit →  看判讀工作站 →

案例 audit:chr2:18M 權威裁決 L2

第二輪程式複核(matched-normal ASM screen + 跨 basecaller FDR)對推論 1–6 逐一裁決;這是同一生物樣本的技術/分析複核,不是獨立 biological replicate。
▸ PI:historical merge-rule 「約 3」不是現行完整 candidate count;normal-ASM-screen-negative {2.1,2.2,3.1,3.2,5.1,5.2}(3.1/3.2 技術重現最強)、confounded {3.3,3.4,3.5,4.1};screen-negative 不證明 acquired 或 clone identity。
看權威 audit →

ISM subclone pipeline 構想 構想 · B2

從 chr2 案例萃取的 9 步候選分析流程(輸入→局部 mutation states→甲基關聯+ASM screen→候選圖)+ 3 防呆。它是構想,非已實作或已驗證的 cellular-subclone 重建器。
▸ PI:核心 = read-level linkage + homopolymer guard + matched-normal ASM screen + 只畫資料支持的候選邊;要升 validated,仍需自動化、獨立 truth、跨樣本與 CN/純度模型。
看 pipeline 構想 →

ISM 能力 vs chr2 敘述 gap 能力對照

把 chr2:18M subclone 敘述逐 claim 對到「ISM C++ as-built 在同一批位點實際算了什麼」:哪些撐得起(characterize)、哪些缺(reconstruct 骨幹)、為什麼。
▸ PI:同一 HCC1395 樣本的 3 個 sSNV 皆有 allele PERMANOVA p=0.001,屬強的 locus-specific allele-associated methylation evidence;不是 3 個獨立 replicate 或 clone validation。ISM 無 cross-SNV linkage/clone tree/corrected CCF。
看能力 vs 敘述 gap →

ism-evolution(統計口徑稽核)★3

ISM 現行版有多個統計口徑問題(Fisher 假獨立 / 5mC-only / germline 軸 Δβ 污染 / 跨 region 無多重檢定),稽核後無翻轉結論但需補修。
▸ PI:PERMANOVA 只測指定 label 與 read-distance variation/centroid separation 在置換 null 下的 association,須合讀 PERMDISP;Fisher/Cramér's V 只測 label association。read 非獨立與跨 region 無 MT 校正會讓 association 顯著率偏樂觀,不能升格為 cluster truth、cellular group 或因果。
待建(偏方法學讀者)

↘ 建議閱讀順序

依「背景先行 + 樞紐優先 + 支撐主軸」。讀到夠就停。

  1. 背景名詞地基 — 先建立語言(HP-axis / ASM / LOH / 統計詞)。→ 已建
  2. ISM 方法本體 — 主軸引擎:作用位置 + 五階段 + 為何用 read-read 距離。→ 已建
  3. ISM 甲基讀取與篩選 — 細節層:MM/ML → 矩陣、二值化灰帶、七道守門、兩種「篩選」(給教授講細節)。→ 已建
  4. chr2:18M 邏輯鏈(給完全不懂的教授) — 第一性原理走查:LOH 降低雙親本解釋 → sSNV 共現/互斥形成局部 mutation-state candidates → 遺傳分組後甲基關聯 → normal ASM screen → 帶不確定性的 read label。→ 已建
  5. 案例:chr2:18M 局部分子狀態候選 — 6 sSNV + 甲基逐步走查,並陳手動直覺與實測校正;不把局部 reads 直接升格成 cellular clone truth。→ 已建
  6. 案例 audit:chr2:18M 權威裁決 — 同一樣本的第二輪程式複核(ASM screen + 跨 basecaller FDR),把甲基分成 normal-ASM-screen-negative 與 confounded;前者不證明 acquired。→ 已建
  7. 判讀工作站:chr2:18M 互動檢視 — 6 sSNV、甲基三組、LOH、歷史 TVAF-derived 非 canonical transform 與 6 項推論裁決;該 transform 不是 CN/純度校正 CCF,也不能 corroborate clone。→ 已建
  8. ISM subclone pipeline 構想(9 步) — 從案例萃取的候選流程:輸入→read linkage→homopolymer guard→甲基關聯 + normal-ASM screen→候選圖;非已驗證重建器。→ 已建
  9. ISM 能力 vs chr2 敘述 gap — 把 chr2:18M 敘述逐 claim 對到「ISM C++ as-built 實際算了什麼」:ISM 撐 characterize 半邊(實測 allele PERMANOVA p=0.001 ×3)、缺 reconstruct 骨幹半邊(linkage/tree/CCF),並標出 SubcloneAnalyzer/TreeStructure 命名 over-claim 風險。→ 已建
  10. HP-axis vs ALLELE-axis — 全專案最易誤讀的軸別 confound(暫在名詞地基 + ISM 頁,將獨立成頁)。
  11. ism-vs-external — ISM 在業界的定位(軸 C vs 軸 A)。待建
  12. 多個 NEGATIVE tests — 只對已測 formulation、scope 與日期成立。待建
  13. LOH-phasing 脊柱 — 主軸 positive headline + 循環性(HD-1)。待建
  14. normal-anchored cis heuristic — 一項待驗證的 project-specific proposed combination,只標記 cis-compatible/copy-screen-negative candidate;在完成具日期的 systematic prior-art search 與 head-to-head comparison 前,novelty/priority 均為 UNVERIFIED,不可宣稱「唯一」或原創優先權。待建