iT邦幫忙

2026 iThome 鐵人賽

DAY 14
0
Build on Google AI

《解構生命暗物質:用 AlphaGenome Atlas 破譯 98% 非編碼基因組的 30 天實戰》系列 第 14 篇

AlphaGenome Atlas 實戰 | Day 14 | 隱藏的致命剪接 —— 從 AVI 指標看透 DNM1 基因異常

  • 分享至 

  • xImage
  •  

💡 導讀:想像電影剪輯師被「假的剪切記號」給騙了……

如果把基因製造蛋白質的過程,比喻成製作一部賣座電影:
https://ithelp.ithome.com.tw/upload/images/20260926/20183596FDhKPhEdoE.png

  • 底片膠捲(pre-mRNA):裡面包含了精彩的正式畫面(外顯子 Exon)以及大量拍攝花絮與NG片段(內含子 Intron)。
  • 電影剪輯師(剪接體 Spliceosome):他的工作就是拿著剪刀,把不需要的花絮(內含子)精準剪掉,只把精彩畫面(外顯子)拼接起來,最後輸出成可以在戲院上映的正式電影(成熟 mRNA)。

但如果有人偷偷在一段本該被剪掉的花絮中間,貼上了一個 偽造的「剪切記號」 呢?

剪輯師被欺騙後,在錯誤的地方剪了一刀,結果把一段荒謬的 NG 花絮也一起黏進了正式上映的電影裡。觀眾(細胞)看了這部結構混亂的電影,做出來的產品(蛋白質)直接癱瘓崩潰!

這就是 AlphaGenome 在那名六週大癲癇嬰兒大腦裡抓到的致命真兇—— 隱藏剪接(Cryptic Splice Site)!今天,我們就來還原這個分子犯罪現場,並看看我們該如何在系統中打造一個「剪接異常偵測器」!


一、 血液檢測為何撲空?專屬大腦的「限制級電影」

昨天我們提到,醫療團隊曾試圖從嬰兒的血液中提取 RNA 進行定序,想看看基因表現有沒有出錯,結果血液報告卻「一片祥和」,什麼異常都沒抓到。

AlphaGenome 點出了血液檢測失敗的殘酷真相:組織特異性(Tissue Specificity)。

這個發生在 DNM1 基因上的突變,影響的是一段 **專屬於大腦神經元(特別是麩胺酸能神經元 Glutamatergic neurons)**才會上映的「神經元限定版電影」。

  • 在大腦神經元裡:這部電影天天播放,這個突變貼上的假剪切記號引發了劇烈的播映慘案。
  • 在血液細胞裡:血液電視台根本沒有這部電影的播放權,這段基因處於完全「靜音停播」狀態。

去血液水管裡採樣,當然什麼異常訊號都抓不到!AlphaGenome 直接在電腦裡模擬大腦神經元的內部環境,才讓這個藏在大腦深處的慘案重見天日。


二、 暗物質裡的刺客:隱藏剪接與「框內延長(In-frame Insertion)」

那麼,這個深藏在 98% 基因暗物質(深層內含子)裡的單一 DNA 字母突變(G>A),究竟是如何毀掉大腦的?

  1. 憑空創造假記號:這個單字母替換,意外在內含子深處創造出了一個原本不存在的「隱藏 3' 剪接受體位點(Cryptic Splice Acceptor Site)」。
  2. 剪輯師落入陷阱:大腦神經元裡的剪接體(剪輯師)把這個假記號當真了,在錯誤的位置硬生生切了一刀。
  3. 多切了 39 個字母進去:結果,上游 39 個原本該丟棄的內含子花絮字母,被一起黏進了成熟的 mRNA 膠捲裡!
  4. 精準多出 13 個胺基酸(框內延長):因為細胞翻譯蛋白質時是每 3 個字母合成一個胺基酸((39 \div 3 = 13)),最終做出來的 Dynamin 蛋白質前端,精準多出了 13 個異常的胺基酸片段。

這多出來的 13 個胺基酸就像是在齒輪上硬塞了一顆小石頭,徹底破壞了 Dynamin 蛋白質的結構,讓神經突觸無法正常傳導訊號,引發了嬰兒毀滅性的癲癇發作!

步驟 正常的剪接過程(健康狀態) 發生突變後的異常剪接(嬰兒大腦) 最終對蛋白質的影響
1. 記號識別 剪接體準確識別正確的外顯子邊界。 突變創造了偽造的「隱藏剪接記號」。 剪接體被欺騙,切錯位置。
2. 內含子處理 內含子花絮被 100% 完美切除丟棄。 保留了 39 個本該丟棄的內含子字母。 成熟 mRNA 裡面摻雜了廢料。
3. 蛋白質成品 產出正常長度、功能完整的蛋白質。 產出過長、多出 13 個胺基酸的蛋白質。 蛋白質結構損壞,失去神經傳導功能。

💻 三、 實作:🧩【里程碑 2】複盤主題數據庫 (verify_disease_dataset.py)

今天,我們迎來第二階段的終極成果!

我們讀取你在 config.py 選定的研究主題,一次批量測試 3 個同領域的候選變異,並在 Terminal 終端機印出一張 「多變異分子特徵對比表」!

💻 程式碼:verify_disease_dataset.py

# verify_disease_dataset.py - 里程碑 2:自訂主題多變異特徵對比表
import config
from track_feature_extractor import AlphaGenomeFeatureExtractor

def run_disease_dataset_benchmark():
    # 根據讀者主題,設定 3 個候選測試變異
    candidate_variants = [
        config.TEST_VARIANT,
        f"{config.TEST_VARIANT.split(':')}:128225900:A:G",
        f"{config.TEST_VARIANT.split(':')}:128225910:C:T"
    ]

    extractor = AlphaGenomeFeatureExtractor(target_tissue=config.TARGET_TISSUE)

    print("="*75)
    print(f"📊【 里程碑 2:{config.MY_DISEASE} - 候選變異多模態特徵對比表 】")
    print(f"🧬 目標基因 : {config.MY_GENE} | 🎯 目標器官 : {config.TARGET_TISSUE.upper()}")
    print("="*75)
    print(f"{'變異座標':<22} | {'AVI分數':<8} | {'剪接 Delta':<10} | {'破壞 Motif 家族':<18}")
    print("-" * 75)

    for var in candidate_variants:
        res = extractor.extract_all(var)
        print(f"{res['variant_id']:<22} | {res['avi_score']:<8.1f} | {res['max_delta_splicing']:<+10.4f} | {res['affected_tf_motif']:<18}")

    print("="*75 + "\n")

if __name__ == "__main__":
    run_disease_dataset_benchmark()

🖥️ 終端機執行結果範例 (Terminal Output)

當在 Terminal 輸入 python verify_disease_dataset.py 時,會拿到這張 里程碑 2 對比表:

===========================================================================
📊【 里程碑 2:難治型幼兒癲癇 (Epileptic Encephalopathy) - 候選變異多模態特徵對比表 】
🧬 目標基因 : DNM1 | 🎯 目標器官 : BRAIN
===========================================================================
變異座標                   | AVI分數   | 剪接 Delta | 破壞 Motif 家族
---------------------------------------------------------------------------
chr9:128225994:G:A      | 24.7     | +0.8700    | TP63 / TP53 家族
chr9:128225900:A:G      | 18.2     | +0.4200    | TP63 / TP53 家族
chr9:128225910:C:T      | 5.4      | +0.0100    | TP63 / TP53 家族
===========================================================================

目前已經完成了 NumPy Delta 矩陣減法、Motif 破壞 與 3D 折疊,並印出了一張多變異對比表格,提取特定器官的波形、計算 NumPy Delta Score、捕捉 Motif 破壞與 3D Contact Map。

之後要開始進行數據工程——批次處理、VCF 解析與快取管線 (Day 15 – Day 18) 的實作。

但在真實的臨床與研究情境,一名病患的 VCF 基因檔案 動輒包含幾百個初篩變異。如果我們呆呆的一個個發送網路請求排隊等,不僅要等好久,還可能因為請求太頻繁被伺服器當成駭客阻擋!

接下來的核心目標是:「從單點查詢升級為批量高吞吐處理」——學習如何解析真實的 VCF 身分證總清冊、用 asyncio 非同步併發 狂飆 10 倍速度、用 指數退避 (Exponential Backoff) 避開 API 封鎖,並在第 18 天打造出一套 0.001 秒回傳的 VCF 自動化快取管線 (Milestone 3)!



上一篇
AlphaGenome Atlas 實戰 | Day 13 | 頑固型癲癇謎團 —— 當全基因組與 RNA 檢測都找不到病因
下一篇
AlphaGenome Atlas 實戰 | Day 15 | 高通量飽和突變驗證 ——生物資訊學如何指導Wet lab閉環
系列文
《解構生命暗物質:用 AlphaGenome Atlas 破譯 98% 非編碼基因組的 30 天實戰》 共 19 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言