iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

打開黑盒子:大型語言模型的機制解釋性入門 系列

這個系列面向具備基本 AI 與機器學習能力的讀者。Mechanistic Interpretability 是 AI Safety 中重要的一環:當模型能力愈來愈強,我們不只需要評估它做了什麼,也需要理解、監控甚至介入它內部形成行為的機制。文章將從「 factual recall」這個小謎題出發,循序介紹 probing、causal intervention、circuits 與 model psychology 等。每篇以問題帶出方法,搭配圖解、互動工具與可執行範例,帶讀者理解現有工具能回答什麼、不能證明什麼,並具備設計自己第一個 interpretability 小實驗的基礎。

參賽天數 27 天 | 共 27 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1|為什麼要打開黑盒子?

2026 年 7 月,OpenAI 在進行 AI 模型網路攻防能力的內部評估時,發生了一起意料之外的事件。 測試中,AI agent 原本被限制在隔離的評估環境...

2026-08-28 ‧ 由 howardhsuuu 分享
DAY 2

Day 2|黑盒子裡有什麼?

上一篇我們談到,如果想理解大型語言模型,只觀察輸入與輸出是不夠的,我們需要開始往模型裡面看。但在拿出各種 interpretability 工具以前,我們得先討...

2026-08-29 ‧ 由 howardhsuuu 分享
DAY 3

Day 3|模型裡真的存在「概念」嗎?

上一篇我們把 Transformer 簡化成了一條不斷被讀取、修改的 Residual Stream。在繼續討論 representation 以前,我們可以先...

2026-08-30 ‧ 由 howardhsuuu 分享
DAY 4

Day 4|如果模型裡有「概念」,我們怎麼把它讀出來?

上一篇我們提出了一個可能的想法:模型會在 Residual Stream 中形成 representation,而其中一些 concept,可能可以用 acti...

2026-08-31 ‧ 由 howardhsuuu 分享
DAY 5

Day 5|我挖到線索了,但它們代表什麼?

上一篇我們用 Linear Probe 做了一件很簡單、直觀的事情,利用模型某層的 activation,嘗試訓練簡單的線性分類器,判斷是否存在與我們關心的「概...

2026-09-01 ‧ 由 howardhsuuu 分享
DAY 6

Day 6|模型從什麼時候開始決定它的答案?

上一篇我們整理了 Mechanistic Interpretability 裡幾種不同的 evidence,現在我們終於可以開始介紹更多工具了!首先,我們回到一...

2026-09-02 ‧ 由 howardhsuuu 分享
DAY 7

Day 7|把手伸進黑盒子,真的可以控制模型行為嗎?

上一篇我們用 Logit Lens 觀察模型在不同 layer 中對答案的傾向,這仍然主要停留在 observation / localization,今天我們...

2026-09-03 ‧ 由 howardhsuuu 分享
DAY 8

Day 8|模型到底是怎麼一步一步得出答案的?

上一篇我們用 Activation Patching 做了第一次真正的 intervention。但就算我們能說這個位置對模型行為有 causal influe...

2026-09-04 ‧ 由 howardhsuuu 分享
DAY 9

Day 9|模型裡真的找得到人類能理解的 Circuit 嗎?

前兩天我們做了兩件事,先用 Activation Patching 找出「哪些位置可能重要,有因果層級的影響力」,再用 Path / Attribution P...

2026-09-05 ‧ 由 howardhsuuu 分享
DAY 10

Day 10|Circuit 一定要靠人一條一條找嗎?

上一篇我們看了 Induction Heads 和 IOI,知道研究者確實可以把某些模型行為拆成一組可理解的 circuit。但這些經典案例都有一個共同問題:很...

2026-09-06 ‧ 由 howardhsuuu 分享