iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

打開黑盒子:大型語言模型的機制解釋性入門 系列

這個系列面向具備基本 AI 與機器學習能力的讀者。Mechanistic Interpretability 是 AI Safety 中重要的一環:當模型能力愈來愈強,我們不只需要評估它做了什麼,也需要理解、監控甚至介入它內部形成行為的機制。文章將從「 factual recall」這個小謎題出發,循序介紹 probing、causal intervention、circuits 與 model psychology 等。每篇以問題帶出方法,搭配圖解、互動工具與可執行範例,帶讀者理解現有工具能回答什麼、不能證明什麼,並具備設計自己第一個 interpretability 小實驗的基礎。

參賽天數 27 天 | 共 27 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 11

Day 11|我們真的找到了模型內部的「演算法」,還是只是過度解釋?

前幾篇我們一路從 Probe、Logit Lens、Activation Patching,到 circuit discovery,開始能回答很多不同層次的問題...

2026-09-07 ‧ 由 howardhsuuu 分享
DAY 12

Day 12|如果一個 Neuron 疊加了多種「概念」,我們要怎麼分析?

前面幾篇中,我們一直在尋找模型內部有意義的 representation。 我們可以用 Linear Probe 檢查某項資訊能不能從 activation 中...

2026-09-08 ‧ 由 howardhsuuu 分享
DAY 13

Day 13|SAE 拆出了 Features,但我們怎麼知道它們代表什麼?

上一篇我們介紹了 Sparse Autoencoder。它把模型原本的 activation x,轉換成一組通常維度更高、但每次只有少數位置啟用的 latent...

2026-09-09 ‧ 由 howardhsuuu 分享
DAY 14

Day 14|Feature 的意義找到了,但模型怎麼使用它?

前兩篇中,我們先用 Sparse Autoencoder,把模型某個位置的 dense activation 分解成一組 sparse features;接著透...

2026-09-10 ‧ 由 howardhsuuu 分享
DAY 15

Day 15|黑盒子裡的線索,終於能拼成一張圖了嗎?

上一篇,我們用 Cross-Layer Transcoder(CLT)近似模型的 MLP computation。Notebook 也讓我們實際看到一個 act...

2026-09-11 ‧ 由 howardhsuuu 分享
DAY 16

Day 16|模型更新之後,我們能替它做一次 git diff 嗎?

上一篇,我們透過 Attribution Graph,追蹤一個模型在特定 prompt 下,可能用了哪些中間 features 產生答案。但如果模型更新了呢?昨...

2026-09-12 ‧ 由 howardhsuuu 分享
DAY 17

Day 17|模型的 Weights 會不會是更直觀的觀察對象?

到目前為止,我們幾乎都在研究模型運行時產生的 activation。給模型一段輸入後,我們讀取 Residual Stream、訓練 Probe、進行 Acti...

2026-09-13 ‧ 由 howardhsuuu 分享
DAY 18

Day 18|「理解」模型有什麼用?

Day 3 曾經介紹過 Linear Representation Hypothesis:某些 concept 可能以 activation space 中相對...

2026-09-14 ‧ 由 howardhsuuu 分享
DAY 19

Day 19|可以用 Steering 按下按鈕,讓模型做指定的任務嗎?

上一篇我們從正面、負面句子的 activation difference 中建立 steering vector,再把它加入新的 forward pass,改變...

2026-09-15 ‧ 由 howardhsuuu 分享
DAY 20

Day 20|Steer 一個 Concept,真的只需要一條 Direction 嗎?

過去兩篇中,我們使用一條 activation direction 來控制模型。這些方法之所以吸引人,很大一部分正是因為它們非常簡單,但這也隱含了一個很強的假設...

2026-09-16 ‧ 由 howardhsuuu 分享