本系列以開源的 Pi Coding Agent 為實作基礎,檢驗一個問題:模型不變的前提下,harness 設計能把 coding agent 的可靠性推到什麼程度?
內容依序拆解 Agent Loop、Context 載入、Skills 與 Tool Runtime,接著為 Pi 建立 trace 與 metrics 管線,並設計一組可重複執行的測試任務。最後以對照實驗回答:拿掉某個 harness 元件,任務成功率、token 成本與重試次數各變化多少。
產出是一套可觀測、可評估的 Pi harness,以及一份實驗數據與設計取捨清單。
「對,但感覺可以更好」的感覺 開始認真設計、實作 agent 之後,我很快就遇到一種難以言明的挫折感:模型做出來的結果,常常和我腦中期待的方向差了一截。 它不是...
你以為它答一次,其實它跑了好幾輪 平常我們問 AI 一個問題,它答一次,事情就結束了。但如果你仔細盯著一個 coding agent 做事,會發現完全不是這麼回...
從一個迴圈,長出一張地圖 Day2 建立了一個心智模型:一個 coding agent 收到任務之後,會不斷重複「看現況、想下一步、動手做、看結果」這四站,直到...
一個 Day1 先放著沒展開的問題 Day1 提過一句話:這系列選 Pi Coding Agent 當作實作載體,原因是它開源、而且刻意做得很極簡。當時說「這件...
從今天開始動手 前四天都在講「為什麼」:agent loop 是什麼、harness 有哪些元件、為什麼選 Pi。今天開始動手——在 Windows 上把 Pi...
文件沒寫的,記錄裡都有 Day4 提過一件事:Pi 的官方文件沒有用文字說明它的 agent loop 怎麼運作。但它有一個更直接的東西——每一次對話都會留下完...
一次成功不代表什麼 Day6 看到 Pi 照著 AGENTS.md 把一個 API 做對了。但這只是一次執行——換個時間再跑,它可能漏掉一個註冊點;拿掉 AGE...
今天拆第一個元件 量測台搭好了,第一輪「拆一個元件、隔天量它」從 AGENTS.md 開始。它是 Day3 地圖上「看現況」那一站最重要的東西:把「這個專案該怎...
實驗設計 Day8 拆完 AGENTS.md 的載入規則,今天量它值多少。 三個任務:T1 修分頁 bug(對照組,不需要專案知識)、T2 新增 endpo...
AGENTS.md 裝不下的東西 Day8 拆完 AGENTS.md:它會被整份塞進 system prompt,每一輪都跟著送出去。這代表一件事——它有成本上...