iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

從 MCP 到專屬 Agentic 模型:30 天走完一條可評測、可微調、可自架的 AI Agent 模型與服務製作流程 系列

大家可以試想一件事情:Agent 製作時,Prompt 調到極限之後呢?當工具的使用慣例無法用 JSON Schema 表達、只能寫在自然語言裡,除了反覆調 Prompt,還有什麼別的辦法?

預期作法是把「工具內化進權重」完整走一遍:先用 MCP 打造一組請假系統工具,部署到 Google Cloud Run;用 Google ADK 接上 Agent 之後,開始觀察哪裡可能會犯錯;用評測把錯誤率量化、把高分維持、低分修正答案,萃取成訓練資料,並且微調成一個小模型、用 vLLM 自架,最後回到評測做模型前後對比。

期待可以讓大家看到 Prompt 和 RAG 之外的另一條路!

參賽天數 8 天 | 共 30 篇文章 | 6 人訂閱 訂閱系列文 RSS系列文
DAY 8

[ AI Agent ] Day 11 — Tracing、Event 記錄與除錯實戰:把每一輪決策變成可查的資料

I. 前言:Agent 不是不能除錯,是沒有斷點 寫傳統程式時,遇到問題的處理方式相當直覺:下個中斷點、單步執行、看變數。因為程式的每一步都是我們自己寫的,行...

2026-09-10 ‧ 由 simonliuyuwei 分享
DAY 8

[ DevOps in AI Agent ] Day 12 — ADEval 架構與指標體系:知道指標的偏誤,比知道分數更重要

I. 前言:一個分數,不足以描述 Agent 的行為 昨天留下了三個尚未回答的問題:工具比對要不要檢查參數、多呼叫了一個工具算不算錯、以及呼叫順序重不重要。...

2026-09-18 ‧ 由 simonliuyuwei 分享
DAY 8

[ DevOps in AI Agent ] Day 13 — 建置評測環境、Baseline 與 Prompt 的極限:把那條界線畫出來

I. 前言:測試案例的覆蓋面,決定了診斷的精度 評測環境的建置本身並不困難,pip install 加上幾行設定就能跑起來。真正花時間、也真正影響結果的,是測...

2026-09-18 ‧ 由 simonliuyuwei 分享
DAY 8

[ DevOps in AI Agent ] Day 14 — 引入 Twinkle Eval:用標準 Benchmark 守住通用能力

I. 前言:一把尺只能量一個維度 Day 12 與 Day 13 建立了以 ADEval 為核心的評測流程,它在工具呼叫的名稱、參數與順序上提供了相當嚴苛的診...

2026-09-18 ‧ 由 simonliuyuwei 分享
DAY 8

[ Agentic Data ] Day 15 — 從 Google ADK 日誌到 Agentic Dataset:軌跡切分與資料轉換

I. 前言:資料不是一句問答,而是一段推理軌跡 在傳統的 LLM 微調中,訓練資料往往是簡單的 {"prompt": "...&...

2026-09-18 ‧ 由 simonliuyuwei 分享
DAY 8

[ Agentic Data ] Day 16 — 負面樣本設計、資料擴增與反向驗證:守住品質防線

I. 前言:擴增的是表達方式,不是正確行為 昨天的結論相當明確:從評測軌跡萃取出來的黃金資料,去重之後只有幾十筆,而這個量級不足以讓模型穩定學會一組工具的使用...

2026-09-18 ‧ 由 simonliuyuwei 分享
DAY 8

[ Model Fine-Tuning ] Day 17 — 開源基座模型選型與 Loss Mask 原理:不懲罰環境輸出

I. 前言:選型判準不只是 Benchmark 分數 在小語言模型(SLM)快速發展的今天,可用的開源基座相當豐富。Gemma、Qwen、Phi 各自都有多種...

2026-09-18 ‧ 由 simonliuyuwei 分享
DAY 8

[ Model Fine-Tuning ] Day 18 — Google Colab Pro 與 Colab CLI 工具鏈實戰:低成本跑通雲端訓練

I. 前言:硬體不該是微調的門檻 在分享微調相關主題時,我最常聽到的一句話是:「我手邊只有一台 MacBook,沒有 RTX 4090,微調是不是與我無緣?」...

2026-09-18 ‧ 由 simonliuyuwei 分享
DAY 8

[ Model Fine-Tuning ] Day 19 — Prompt Template 取捨與訓練前 Sanity Check:先跑通再放大

I. 前言:訓練與推論之間,有一個容易被忽略的契約 微調的效益之一是節省 Token。當工具的使用規則被內化進權重之後,System Prompt 就不必每次...

2026-09-18 ‧ 由 simonliuyuwei 分享
DAY 8

[ Model Fine-Tuning ] Day 20 — 執行 SFT 微調與 Loss 曲線判讀:從訓練損失看見工具能力

I. 前言:一個會誤導人的指標 前面十九天的準備工作,都是為了今天按下訓練鍵的這一刻。 而按下之後,最直覺的判斷依據就是 loss 曲線 —— 它平穩下降,我...

2026-09-18 ‧ 由 simonliuyuwei 分享