iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

打開黑盒子:大型語言模型的機制解釋性入門 系列

這個系列面向具備基本 AI 與機器學習能力的讀者。Mechanistic Interpretability 是 AI Safety 中重要的一環:當模型能力愈來愈強,我們不只需要評估它做了什麼,也需要理解、監控甚至介入它內部形成行為的機制。文章將從「 factual recall」這個小謎題出發,循序介紹 probing、causal intervention、circuits 與 model psychology 等。每篇以問題帶出方法,搭配圖解、互動工具與可執行範例,帶讀者理解現有工具能回答什麼、不能證明什麼,並具備設計自己第一個 interpretability 小實驗的基礎。

參賽天數 27 天 | 共 27 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 21

# Day 21|模型內的 Concept 到底是什麼形狀?

過去幾篇中,我們逐步放寬了對 representation 的想像。一開始,我們假設某個 concept 可以用一條 direction 表示;接著,我們用 C...

2026-09-17 ‧ 由 howardhsuuu 分享
DAY 22

Day 22|如果 Concept 的形狀不是線性的,那應該怎麼 Steer?

上一篇我們看到,模型內部的 concept 可能不是一條 direction,也不是一個平坦的 subspace,而是一個具有彎曲結構的 manifold。這對...

2026-09-18 ‧ 由 howardhsuuu 分享
DAY 23

Day 23|模型的 CoT,可以解釋他的行為嗎?

過去幾篇中,我們已經用各種不同方式讀取、改變模型內部的 representation。或許你已經覺得:「這些方法又雜又各自只能拼湊拼圖的一小塊,現在模型能力這麼...

2026-09-19 ‧ 由 howardhsuuu 分享
DAY 24

Day 24|可以直接把 Activation 翻成文字嗎?

上一篇我們看到,模型寫出的 Chain-of-Thought 不一定忠實反映真正影響答案的 computation。如果直接問模型「你為什麼這樣回答?」它可能說...

2026-09-20 ‧ 由 howardhsuuu 分享
DAY 25

Day 25|我們能偷看模型沒說出口的「想法」嗎?

上一篇,我們嘗試把 activation 翻成文字。但一段讀起來很合理的 explanation,不一定忠實反映模型真正使用的資訊。今天,我們想再往前問一步:模...

2026-09-21 ‧ 由 howardhsuuu 分享
DAY 26

Day 26|模型可以察覺自己的內部狀態嗎?

一路上我們探索了許多觀察模型內部 representation 的工具,但他們都是在模型之外額外訓練一個工具,或是把 activation 拿出來額外分析得出拼...

2026-09-22 ‧ 由 howardhsuuu 分享
DAY 27

Day 27|我們能像研究人一樣,研究模型的「心理」嗎?

如果我們想了解一個人,通常不會只看他回答某一道題目是否正確。我們也會觀察:他會不會為了得到認同而附和別人?遇到挫折時,會繼續嘗試、承認做不到,還是開始走捷徑?換...

2026-09-23 ‧ 由 howardhsuuu 分享