大家可以試想一件事情:Agent 製作時,Prompt 調到極限之後呢?當工具的使用慣例無法用 JSON Schema 表達、只能寫在自然語言裡,除了反覆調 Prompt,還有什麼別的辦法?
預期作法是把「工具內化進權重」完整走一遍:先用 MCP 打造一組請假系統工具,部署到 Google Cloud Run;用 Google ADK 接上 Agent 之後,開始觀察哪裡可能會犯錯;用評測把錯誤率量化、把高分維持、低分修正答案,萃取成訓練資料,並且微調成一個小模型、用 vLLM 自架,最後回到評測做模型前後對比。
期待可以讓大家看到 Prompt 和 RAG 之外的另一條路!
I. 前言:Agent 不是不能除錯,是沒有斷點 寫傳統程式時,遇到問題的處理方式相當直覺:下個中斷點、單步執行、看變數。因為程式的每一步都是我們自己寫的,行...
I. 前言:一個分數,不足以描述 Agent 的行為 昨天留下了三個尚未回答的問題:工具比對要不要檢查參數、多呼叫了一個工具算不算錯、以及呼叫順序重不重要。...
I. 前言:測試案例的覆蓋面,決定了診斷的精度 評測環境的建置本身並不困難,pip install 加上幾行設定就能跑起來。真正花時間、也真正影響結果的,是測...
I. 前言:一把尺只能量一個維度 Day 12 與 Day 13 建立了以 ADEval 為核心的評測流程,它在工具呼叫的名稱、參數與順序上提供了相當嚴苛的診...
I. 前言:資料不是一句問答,而是一段推理軌跡 在傳統的 LLM 微調中,訓練資料往往是簡單的 {"prompt": "...&...
I. 前言:擴增的是表達方式,不是正確行為 昨天的結論相當明確:從評測軌跡萃取出來的黃金資料,去重之後只有幾十筆,而這個量級不足以讓模型穩定學會一組工具的使用...
I. 前言:選型判準不只是 Benchmark 分數 在小語言模型(SLM)快速發展的今天,可用的開源基座相當豐富。Gemma、Qwen、Phi 各自都有多種...
I. 前言:硬體不該是微調的門檻 在分享微調相關主題時,我最常聽到的一句話是:「我手邊只有一台 MacBook,沒有 RTX 4090,微調是不是與我無緣?」...
I. 前言:訓練與推論之間,有一個容易被忽略的契約 微調的效益之一是節省 Token。當工具的使用規則被內化進權重之後,System Prompt 就不必每次...
I. 前言:一個會誤導人的指標 前面十九天的準備工作,都是為了今天按下訓練鍵的這一刻。 而按下之後,最直覺的判斷依據就是 loss 曲線 —— 它平穩下降,我...