大家可以試想一件事情:Agent 製作時,Prompt 調到極限之後呢?當工具的使用慣例無法用 JSON Schema 表達、只能寫在自然語言裡,除了反覆調 Prompt,還有什麼別的辦法?
預期作法是把「工具內化進權重」完整走一遍:先用 MCP 打造一組請假系統工具,部署到 Google Cloud Run;用 Google ADK 接上 Agent 之後,開始觀察哪裡可能會犯錯;用評測把錯誤率量化、把高分維持、低分修正答案,萃取成訓練資料,並且微調成一個小模型、用 vLLM 自架,最後回到評測做模型前後對比。
期待可以讓大家看到 Prompt 和 RAG 之外的另一條路!
I. 前言:為什麼要為失敗保留一整天 在規劃這個 30 天系列時,這一天的位置是刻意安排的。 從訓練到最後的驗收,文章能不能順利產出,取決於一件我無法完全控制...
I. 前言:訓練完成,離「能用」還有三步 昨天處理完踩坑與二次訓練,手上有了一個 loss 收斂、快測結果合理的 LoRA Adapter。 但那個 Adap...
I. 前言:唯一的變數應該只有模型本身 從 Day 1 開始鋪陳的所有工作,都是為了今天這一步:在完全相同的條件下,量出微調前後的真實差距。 這件事的難處不在...
I. 前言:驗收完了,現在來拆 昨天完成了三方對決,數字有了。今天要做一件看起來有點多餘、但其實是整個系列最重要的驗證之一:把 Google ADK 整個拿掉...
I. 前言:一個 for 迴圈解決得了的事 昨天把框架拿掉,用八十行原生 Python 跑通了整個 Agent Loop,也算出了自架與商業 API 的損益平...
I. 前言:模式解決的是「不要全塞進一個 Prompt」 昨天釐清了什麼時候該用 Agent。今天處理下一個問題:確定要用 Agent 之後,內部該怎麼組織?...
I. 前言:不安感通常來自詞彙,而不是技術 談 Agent 的時候,充斥著「自主推理」「感知環境」「自我反思」這類詞彙。它們很生動,但對一個寫了十幾年程式的工...
I. 前言:測試環境重跑一次就好,生產環境不行 昨天把 Agent 的概念翻譯回工程語言,其中最關鍵的一句是:dispatch 變成機率性的。 在測試環境裡,...
I. 前言:這 28 天其實是一條產線的原型 回頭看這 28 天做的事,有一個結構相當清楚: Day 11 記錄軌跡 → 原料 Day 13 評...
I. 前言:回到 Day 1 的那個承諾 30 天前,第一篇文章寫下的目標是: 打造一個原生擅長操作特定工具的專屬 AI 模型,並且用數據證明它比通用模型強...