本系列以開源的 Pi Coding Agent 為實作基礎,檢驗一個問題:模型不變的前提下,harness 設計能把 coding agent 的可靠性推到什麼程度?
內容依序拆解 Agent Loop、Context 載入、Skills 與 Tool Runtime,接著為 Pi 建立 trace 與 metrics 管線,並設計一組可重複執行的測試任務。最後以對照實驗回答:拿掉某個 harness 元件,任務成功率、token 成本與重試次數各變化多少。
產出是一套可觀測、可評估的 Pi harness,以及一份實驗數據與設計取捨清單。
實驗設計 Day10 說了 Skills 的機制:只有名稱和描述常駐在 system prompt,完整內容要模型自己用 read 去載入。今天量它值多少。...
迴圈的「動手做」那一站 前面幾天都在拆「看現況」:AGENTS.md(Day8)、Skills(Day10)。今天換到迴圈的另一站——動手做。 模型自己不會執行...
題目為什麼改了 原本的大綱寫的是「拿掉 grep/find/ls 的代價」。實際動手之後發現前提就錯了:Pi 預設根本沒開這三個工具(Day12),預設只有 r...
把最上面那一層打開 前面拆了 AGENTS.md(Day8)、Skills(Day10)、工具(Day12)。這些東西最後都會匯集到同一個地方:system p...
彈性格的第一格 大綱裡 Day15、22、29 是「彈性格」——有題目可以寫,但隨時可以被意外取代。今天沒有意外,所以照原計畫做一個小實驗。 題目是從 Day1...
迴圈裡唯一不是「做」的那一站 Day2 把 agent loop 拆成四站:看現況、想下一步、動手做、看結果。前面幾天拆的都是「看現況」(AGENTS.md、S...