解釋中心
解釋中心 · 名詞地基 · background-glossary

背景名詞地基

整個研究的「語言」。每個術語給 一句白話 → 直覺類比 → (折疊)嚴謹定義 + 常見誤解;統計方法的詞另附 worked example(怎麼算)。其他頁的術語首次出現都連回這裡。

L0 這頁怎麼用

這頁是全站名詞的單一真相來源(SoT)。任何頁看到不懂的術語,點它連回這裡的對應卡片。讀到夠就停——L0 標題行 + 直覺類比通常就夠;要嚴謹定義/公式再展開 ▸。

▸ 給 PI:本研究最關鍵的語言是 HP-axis(project-specific somatic-conditioned)vs ALLELE-axis(易混入 germline baseline)、「observed association ≠ 能判別」、以及 excess-over-null(不能比 raw rate)——這三個定義決定了所有結論能不能成立。

● 全站 4 條鐵則
  1. 「具名 scope 有 allele-associated methylation」≠「能判別 TP/FP」——兩個 claim 永遠分開講。
  2. HP-axis(HP1 vs HP1-1)是 project-specific somatic-conditioned comparison,可減少部分 context confound;ALLELE-axis(ALT vs REF)易混入 germline het baseline。兩者都不是 confound-free 或 causal 軸。
  3. 絕對 AUC 在甲基-phasing 場景系統性膨脹(germline het null median 0.974);引相對 null 不引絕對 AUC。
  4. 甲基→TP/FP filter 的已測 formulation 為 concluded negative;重開須 materially new hypothesis + pre-decision audit。同 haplotype 內 T3 亦只對已測設計為 negative。

快速索引(28 詞)

🧮 = 附 worked example · 🧩 = 高認知負荷 · 完整 92 詞 SoT:InterSubMod/docs/explain/_planning/02_名詞表_glossary.md

① Haplotype 與 Phasing

「這條 read 來自哪一條染色體版本」這件事的詞彙。

Haplotype(單倍體型) — 同一條染色體上、來自單一親代的一組等位
直覺:你每對同源染色體一條來自父、一條來自母(HP1 / HP2);用 germline 雜合 SNP 當路標就能判斷一段 DNA 屬哪一條。
例:一條 read 同時覆蓋 3 個 germline het SNP,等位組合一致指向 HP1 → 該 read 歸 HP1。

常見誤解:把 HP1/HP2 當「第幾號染色體」;它是「同一對同源染色體的父本 vs 母本版本」。關聯:HP-tag · HP1-1 · Phasing

HP-tag(HP:i:)— BAM 裡每條 read 的單倍型標籤
直覺:每條 read 讀完貼標籤:「父本(HP1)」「母本(HP2)」「帶突變的腫瘤亞株(HP1-1)」「身份不明(unphase/HP0)」。

longphase-S(paired)下 HP=1/2 為 germline;somatic haplotagging 6-state 另有 HP=11(HP1-1)/21(HP2-1)/HP3/HP0。常見誤解:把 HP=11 當第三條染色體或 copy number 標記。

HP1-1(somatic sub-haplotype) 🧩 — HP1 鏈上帶 somatic 突變的子群,非第三條染色體
直覺:父親那條染色體(HP1)上後天突變的那些 reads 單獨標出來:HP1-1 = 父那條 + 突變、HP1 = 父那條 + 沒突變。
例:比 HP1(無 somatic)vs HP1-1(有 somatic ALT)的甲基差,可在這個 project-specific 分組下減少部分染色體身份混淆;它不證明 copy number、germline 或 drift confound 已全部移除。

常見誤解:(1) 誤為第三單倍型;(2) 誤為 copy loss / CN tag;(3) 誤為一定能乾淨偵測(依賴 longphase-S,LOH 區反而最難 phase)。圖見 ISM 頁。

Phasing(定相) — 用 germline het SNP 判斷片段屬 HP1 或 HP2
直覺:考古學家用「哪些陶片在同一層土」判斷屬同一罐子;phasing 用「哪些 SNP 在同一條 DNA 分子」判斷屬同一親代版本。長讀一條夠長、能跨多 SNP,精度遠勝短讀。

常見誤解:以為到處可 phase;LOH 區 germline het SNP 消失 → 失去錨點(這正是 methyl-assisted phasing 想救的白地)。

unphase read — longphase 未能分配 HP 的 read(缺本地 germline 錨點)
直覺:地圖上一條沒地址的路,因附近沒足夠路標,既沒標「北」也沒標「南」。

常見誤解:以為「救援 unphase」到處可行;多數 unphase read 落在 LOH/imprinting 區(germline SNP 稀疏)→ 無本地錨點建甲基參考 → 機制恰在最需要處失效(chicken-egg)。

LOH-constrained phasing — 理想化單親/單-haplotype 模型下的「同-hap 分裂」假說
直覺(理想化模型):若某區確實只保留單一 parental haplotype,後續 mutation-bearing reads 可能在同一 hap 上形成分裂式 occupancy pattern(Inner = HP1+HP1-1 同 hap;Outer = HP1+HP2-1 跨 hap)。

常見誤解:SEQC2 LOH annotation 或 HP imbalance 本身不能區分 deletion/CN-loss、copy-neutral LOH、保留哪個 parental copy 或其他機制;CN 尚未整合。也不可把此 phasing signature 當「甲基化雙峰」(HPFineNGroups 曾被誤解,實為 phasing×allele occupancy count)。⚠ 帶 by-construction circularity。

self-phasing 循環依賴 / by-construction circularity 🧩 — somatic 變異同時當「定位標誌」與「被定位對象」
直覺:讓嫌疑人自己當法官判自己有沒有罪,判決當然有利自己;somatic ALT reads 既是 phasing anchor 又是被評估對象 → 系統性偏同一 HP group → 虛假 LOH 訊號。

移除 self-phasing 後大量 TO-mode TP LOH 消失。決定性負控需 --germline-hp-only flag 關 somatic tagging 重觀察(R-SELFREF);未跑前 phasing 脊柱證據封頂 Grade B+ 非 Grade A。

HPFineNGroups 🧩 — 四個 sub-haplotype bucket 有幾個被填滿(occupancy count,非甲基峰數)
直覺:reads 依 HP tag 分四抽屜(HP1/HP1-1/HP2/HP2-1),HPFineNGroups = 「幾個抽屜有 reads」的計數,不是甲基化有幾個峰。

常見誤解:因名字像「HP 細分 N 個甲基 group」而誤為甲基雙峰;C++ 原始碼(LabelTest.cpp hp_to_fine_labels)確認為 occupancy count。→ feature name 必查源碼的經典案例。

② 變異與 Copy Number

somatic / germline、LOH、copy number — 用來界定 ASM 是否與 normal-anchored cis-association candidate 相容,以及仍有哪些 confound;這類 association 不證明因果或 tumor-acquired。

Somatic vs Germline mutation — 後天獲得(不遺傳,腫瘤目標)vs 出廠設定(所有細胞、會遺傳)
直覺:germline = 出廠設定(每個細胞都有);somatic = 某細胞後天的小傷痕(只傳給它的子代細胞)。

paired tumor-normal calling(ClairS)通常改善 somatic/germline 分離,但仍不完美,必須以 truth benchmark 驗證;ClairS-TO(tumor-only)分離限制更大。常見誤解:以為 caller 報出都是 somatic。關聯:TP/FP · germline-het 對照

LOH(雜合性缺失) — 腫瘤失去一個等位,該區只剩單一 haplotype
直覺:本來父母各一份(雜合),腫瘤把其中一份弄丟(或被另一份取代)→ 該區 germline het SNP 消失 → phasing 失錨。
對 phasing 的衝擊:LOH 區是 methyl-assisted phasing 的「白地」(最需要、也最難)。
cnLOH(copy-neutral LOH) — 兩條都變成同一等位,但拷貝數仍 = 2
直覺:LOH 有兩種:CN loss(CN=1,少一條)或 cnLOH(CN=2,兩條都同一等位)。後者拷貝數沒變但雜合性沒了。

區分重要,因為 ASM 的 copy confound 要看實際 CN,cnLOH 與 CN-loss 對 dosage 假象的影響不同。

Copy Number (CN) — 某染色體區段的拷貝數;CN 變化製造 ASM 假象
直覺:某 haplotype copy 變多,它的 reads 份數就多,平均甲基「看起來偏一邊」其實只是份數多 → 假的等位差異(dosage confound)。

文獻:apparent ASM 有 82–92% 可被 copy 數解釋(Martin-Trujillo 2017)→ 本專案以 normal-anchored cis heuristic 標記與部分 observed copy pattern 不相容的候選;它不是完整 CN 校正,也不證明 copy confound 已移除。

ASM(allele-specific methylation) 🧩 — 某 haplotype/allele 甲基系統性高/低於另一
直覺:同一個位點,來自父那條的 reads 普遍甲基化、母那條普遍不甲基 → 等位特異性甲基化。
● 兩個軸別不可混:HP-axis(HP1 vs HP1-1,project-specific somatic-conditioned comparison)vs ALLELE-axis(ALT vs REF reads,可能混入 germline 基線等位甲基差)。HP-axis 可減少已觀察到的部分 confound,但不是 causal 或 confound-free 軸。見 HP-axis vs ALLELE-axis。

● 鐵則:ASM「存在」≠「能判別 TP/FP」。本研究 strong-ASM 反而在 FP 富集(OR=0.194)。

TP / FP — caller 報的 somatic SNV 對照真值的真陽性 / 假陽性
直覺:把 caller 報的突變跟「金標準真值」(SEQC2)對:真的有 = TP,誤報 = FP。

HCC1395 主 benchmark 真值 = SEQC2 v1.2.1 的 39,447 somatic SNV。ISM 多輪研究問「甲基特徵能否分 TP/FP」→ 已測 formulation 的答案為 negative;若有 materially new、經 pre-decision audit 的假說,仍可重開驗證。

③ 甲基化

ISM 讀的訊號本身。

CpG — 胞嘧啶接鳥嘌呤的二核苷酸,DNA 甲基化主要發生處
直覺:基因組裡 C 後面接 G 的位置(5'-CG-3');哺乳類 DNA 甲基化幾乎都在這種位置的 C 上。

ISM 對每位點 ±1000bp 視窗內的 CpG 建 read×CpG 矩陣。

5mC vs 5hmC — 5-甲基胞嘧啶 vs 5-羥甲基胞嘧啶(兩種修飾)
直覺:C 上掛甲基(5mC,常見、抑制基因)或羥甲基(5hmC,去甲基中間態)。ONT 可同時 call 兩者。

⚠ ISM 目前 5mC-only(max-collapse 把 5mC+5hmC 議題:盤點建議分軌處理,dup-bug 待修)。

β(甲基率)/ Δβ — 某 CpG 甲基化 read 的比例 [0,1];Δβ = 兩組差(有方向)
直覺:β = 這個 CpG 上「甲基化的 read 佔幾成」;Δβ = HP1-1 的 β 減 HP1 的 β(正負 = 往哪邊偏)。
例:在具名 BRCA2、既定 HP-axis 與該次分析範圍內,observed Δβ = −0.122(HP1-1 的觀測甲基率低於 HP1);這是 scope-bound 差值,不是 causal effect。⚠ −0.054 是 buggy 砍半值,禁用。

⚠ Δβ(甲基率差,有方向)≠ Δ(距離差,無方向)。見 ISM 頁圖。

MM/ML tag — BAM 裡的甲基化標記(位置 + 機率)
直覺:MM = 哪些 C 有修飾(delta-encoded 位置);ML = 每個修飾的機率(0–255,/255 得 0–1)。

ISM 的 MethylationParser 解這兩個 tag,CIGAR→ref 定位 CpG。⚠ MM/ML 解析目前零單元測試(盤點稽核 flag)。

read-level(單分子層) — 保留每條 read 完整甲基 pattern,非 per-position 聚合
直覺:不把同一位點所有 read 平均掉,而是看「每條 read 各自的甲基指紋」——這樣才看得出 read 之間的共甲基化結構。

這是 ISM 站「軸 C(between-read 距離)」對比業界「軸 A(per-position 率差)」的根本差異。

④ 統計與評估 含算式 worked example

方法學的統計詞,每個附「怎麼從數字算出來」的 worked example(輸入為示意數字,算式取自源碼)。

NHD(標準化漢明距離) 🧮 — 兩條 read 甲基 pattern 的差異比例
直覺:兩條 read 各自的甲基「指紋」有多少 CpG 位置不一樣,除以可比較的 CpG 數。0 = 一模一樣、1 = 完全相反。
worked example · NHD NHD = 不一致數 / 共同有效 CpG 數(DistanceMatrix.cpp:23)。
read i = [1, 0, 1, 0, 1]
read j = [1, 0, 1, 1, 1] → 1 個不一致 / 5 共同 = 0.2
effective current CLI 需共同覆蓋 ≥ C_min=3;不足者依預設 --nan-distance-strategy SKIP 標記為無效對並排除。DistanceConfig 的 internal initializer 5 與 legacy/experimental MAX_DIST=1.0 會被 current Config 的 3/SKIP 覆寫,不是無參數生產行為。有效 CLI 在未指定 --distance-metric 時使用 NHD;Config 的 BERNOULLI initializer 會被參數解析器清空,只有明示請求 BERNOULLI 才會走 ML 機率加權路徑。
PERMANOVA(pseudo-F) 🧮🧩 — 問指定 label 與 read-distance variation/centroid separation 是否不符合置換 null
直覺:把 reads 的 HP 標籤隨機洗牌很多次,看觀測標籤下的 centroid separation 是否與指定 null 不相容;仍需同看 PERMDISP 與設計限制。問的是 label-associated separation,不能說成分組真值。
worked example · pseudo-F F = (SS_between / (k−1)) / (SS_within / (N−k))(StructureTest.cpp:150)。
k=2 群, N=6:假設 SS_between=0.50, SS_within=0.10
→ F = (0.50 / 1) / (0.10 / 4) = 0.50 / 0.025 = 20
F 大 = 在指定 label 下 between-label variation 相對 within-label variation 較大。再把標籤洗牌(生產 999 次;src/core/RegionProcessor.cpp 的 structure_config.n_permutations 與 include/core/LabelTest.hpp 均為 999)重算 F,看觀測 F=20 多極端 → p(現行實作分母為 999+1,解析度下限 0.001)。(SS 為示意;實際由距離矩陣算)

常見誤解:把它當「per-CpG 率差」或「unsupervised cluster 存在」檢定。它只測指定 label 與距離 variation/centroid separation 在置換 null 下的 association,且 dispersion 差異也能影響結果,必須與 PERMDISP 合讀;不能證明 cluster truth、cellular group 或因果。

Cramér's V + Cochran gate 🧮🧩 — cluster × label 列聯表關聯強度 + 「表太稀疏就不算數」的閘
直覺:Cramér's V 是 cluster × 指定 label 列聯表的關聯強度,需每格樣本夠多才近似成立;Cochran 檢查另設 reliability 旗標。raw V 不會被函式抹掉,summary projection 才在不可靠時寫 0;legacy gate 仍直接讀 raw V。它不判定 cluster、生物分組或 label 的真值。
worked example · Cramér's V 2×2 時 V = √(χ² / n)(MathUtils.hpp:85,min(r,c)−1=1)。
表 [[30, 8], [6, 25]], n=69 → χ² ≈ 24.3 → V = √(24.3 / 69) ≈ 0.59
可靠性:需 ≥80% 格的期望值 ≥5(Cochran;MathUtils.cpp::cramers_v)才採信;raw V 與旗標分開保存,RegionProcessor 的 summary 才投影為 reliable ? raw_v : 0。
PERMANOVA-positive candidate missed by V gate:gated V=0 但 PERMANOVA 顯著,表示在指定 null 下有 label-associated read-distance variation/centroid-separation candidate、而稀疏 cluster × label 表的 V 不可靠(762 MISSED 中 487 個);須合讀 PERMDISP,不是 latent truth,也不可寫成 filter。
Fisher exact + over-dispersion 問題 🧮🧩 — per-CpG label × methylation association 檢定;長讀違反獨立假設時 p 可能偏樂觀
直覺:擲 100 枚獨立硬幣會集中在平均附近;但同一 biological sample 內的長讀可能彼此相關,實際方差更大。Fisher 假設獨立 → 可能低估 variance → p 偏小 → 顯著 CpG 偏多。
worked example · Fisher 2×2 對單一 CpG 建 2×2(HP1/HP2 × 甲基/未甲基),算「至少這麼極端」的精確機率 p。
HP1: 8 甲基 / 1 未甲 · HP2: 1 甲基 / 7 未甲 → Fisher p ≈ 0.002(看似強)
⚠ 但若這 17 條 read 在同一 biological sample 內相關(非獨立),不確定性可能更大、p 可能偏小。建議用 beta-binomial 或 sample-aware 設計吸收 over-dispersion,或保留 Fisher 但明標 anti-conservative;Fisher 只支持 label × methylation association,不支持群體真值或因果。
BH-FDR(多重檢定校正) 🧮 — 同時做很多檢定時,控制假陽性「比例」
直覺:同時做 1000 個檢定若都用 p<0.05,平均 50 個假陽性;BH 依排名動態調小閾值,使假陽性比例控制在 5%。
worked example · BH-FDR 排序後 q_i = p_i × m / rank_i(m = 檢定總數)。
m=1000:排第 1 的 p=0.00002 → q=0.00002×1000/1=0.02 ✓
排第 50 的 p=0.0025 → q=0.0025×1000/50=0.05(臨界)
⚠ ISM 有 within-region BH,但跨 region / genome-wide 缺校正 → global_p 取多 p 最小值不校正會膨脹假陽性(建議 Sidak/Bonferroni)。
AUC(ROC 曲線下面積) 🧮 — 二元分類器的區分力,0.5=隨機、1=完美
直覺:把一顆 TP 球與一顆 FP 球混抽,AUC = 「TP 球分數較高」的機率。0.5 就是瞎猜。
worked example · AUC 所有 (TP, FP) 配對中 TP 分數較高的比例。
3 TP 分數 [0.9, 0.6, 0.4] · 3 FP [0.7, 0.5, 0.2]
9 配對中 TP>FP 的有 6 個 → AUC = 6/9 ≈ 0.67
⚠ 甲基 |Δβ| 預測 is_TP 的 AUC ≈ 0.505(隨機)→ 此已測 filter formulation 為 negative。且絕對 AUC 在某些設計系統性膨脹(見 excess-over-null)。
excess-over-null(超出隨機基準) 🧮🧩 — 觀測指標 − permutation null,跨樣本只能比這個
直覺:賭博裡看「比莊家多贏的比例」,不是看總共贏多少。許多指標(anchor AUC、ASM rate)的 null 本身就遠離 0.5/0,只看絕對值會把「本來就高的 null」誤當訊號。
worked example · excess-over-null excess = 觀測 − mean(HP-shuffle null)。
某樣本觀測 strong-ASM rate = 0.30;HP 洗牌 null 平均 = 0.13
→ excess = 0.30 − 0.13 = +0.17
跨樣本 ASM 復現要看 6/6 樣本 excess>0(mean 0.168),不是比各樣本 raw |Δβ|(會被覆蓋/樣本大小污染)。
LOSO(留一樣本法) 🧩 — N−1 個樣本訓練、預測留下的 1 個,測真實跨樣本泛化
直覺:用 A/B/C/D 四校的題訓練、去考 E 校;而非用 E 校 80% 題訓練再考 E 校剩 20%(後者作弊成分高 = within-sample k-fold)。
關鍵教訓:甲基 filter 在該輪 in-distribution k-fold 看似 +ΔF1,但 LOSO held-out mean = −0.00004(p=0.125)、跨樣本 transfer 為 −0.377;在該具名資料與 validation design 下沒有顯示可泛化效益,結果與 sample-level circularity相容,但不證明單一因果。這是該已測 formulation的 convergent negative evidence;materially new、經 audit 的假說仍可另案重開。

⑤ 工具與 Pipeline

最容易誤讀的軸別定義,與上下游工具。

HP-axis vs ALLELE-axis 🧩 — project-specific somatic-conditioned 軸 vs 易混入 germline baseline 的軸 ●
直覺:HP-axis 比 HP1(無突變)vs HP1-1(有突變),在本專案標籤定義下固定了部分 haplotype context;ALLELE-axis 比 ALT reads vs REF reads,可能混入 germline 基線等位甲基差。HP-axis 的 observed difference 仍可能受 copy、germline、drift 與標籤誤差影響,不能直接解讀為 somatic causal effect。
數據:project-specific HP-axis 的 observed association(TP 7.2% vs null 4.1%, OR=1.79);ALLELE-axis 與 germline baseline confound 相容(TP 11.1% < het null 15.2%)。所有 LOH 位點只有 ALLELE-axis 可用 → 因此不能排除該 confound。

● 鐵則 2:宣稱 somatic ASM 必附 germline-het negative control。

longphase-S vs longphase-TO — paired(有 normal 錨)vs tumor-only(self-phasing bias)
直覺:longphase-S 用 Normal BAM + germline SNP 當精確錨點;longphase-TO 無 normal,只用 tumor 自身 somatic SNV 推 → 帶 ALT 的 reads 被偏向同一 HP。
數據:TO 模式 94.6% reads 偏 HP1(已知 bias);paired_full ΔF1=+0.0112(canonical),TO ΔF1=−0.0206(NEGATIVE,不可靠)。
normal-anchored cis heuristic — 用 normal 當錨點,標記 cis-compatible/copy-screen-negative 候選
直覺:本專案把 normal-HP1→tumor-HP1 的 observed difference 記為 d_copy/d_drift screen,tumor-HP1→HP1-1 的 observed difference 記為 d_within;它只標記 cis-compatible/copy-screen-negative candidate。

啟發式判準 |d_cis| > 1.8×|d_drift| + 0.02。例 BRCA2 d_within 小、d_copy 大 → 與 observed copy/dosage pattern 相容;chr17/TBC1D16 d_within=0.142, p=0.001 → cis-compatible/copy-screen-negative candidate。此 project-specific heuristic 僅 screen 部分 observed confound,不證明 copy、germline 或 drift 已移除,也不證明 causal cis 或 tumor-acquired。● 單一樣本、僅 HCC1395 有 matched normal