這個系列面向具備基本 AI 與機器學習能力的讀者。Mechanistic Interpretability 是 AI Safety 中重要的一環:當模型能力愈來愈強,我們不只需要評估它做了什麼,也需要理解、監控甚至介入它內部形成行為的機制。文章將從「 factual recall」這個小謎題出發,循序介紹 probing、causal intervention、circuits 與 model psychology 等。每篇以問題帶出方法,搭配圖解、互動工具與可執行範例,帶讀者理解現有工具能回答什麼、不能證明什麼,並具備設計自己第一個 interpretability 小實驗的基礎。
前幾篇我們一路從 Probe、Logit Lens、Activation Patching,到 circuit discovery,開始能回答很多不同層次的問題...
前面幾篇中,我們一直在尋找模型內部有意義的 representation。 我們可以用 Linear Probe 檢查某項資訊能不能從 activation 中...
上一篇我們介紹了 Sparse Autoencoder。它把模型原本的 activation x,轉換成一組通常維度更高、但每次只有少數位置啟用的 latent...
前兩篇中,我們先用 Sparse Autoencoder,把模型某個位置的 dense activation 分解成一組 sparse features;接著透...
上一篇,我們用 Cross-Layer Transcoder(CLT)近似模型的 MLP computation。Notebook 也讓我們實際看到一個 act...
上一篇,我們透過 Attribution Graph,追蹤一個模型在特定 prompt 下,可能用了哪些中間 features 產生答案。但如果模型更新了呢?昨...
到目前為止,我們幾乎都在研究模型運行時產生的 activation。給模型一段輸入後,我們讀取 Residual Stream、訓練 Probe、進行 Acti...
Day 3 曾經介紹過 Linear Representation Hypothesis:某些 concept 可能以 activation space 中相對...
上一篇我們從正面、負面句子的 activation difference 中建立 steering vector,再把它加入新的 forward pass,改變...
過去兩篇中,我們使用一條 activation direction 來控制模型。這些方法之所以吸引人,很大一部分正是因為它們非常簡單,但這也隱含了一個很強的假設...