iT邦幫忙

2026 iThome 鐵人賽

DAY 21
0
AI Engineering

3分鐘 AI Agent導論系列 第 21

[3分鐘 AI Agent導論] Day21 -- 構建Agent的原則&選擇模型

  • 分享至 

  • xImage
  •  

講回來Agent的部分,RAG我們留到周末再來討論。

根據Anthropic的經驗,成功的AI Agent系統遵循3個核心原則。

保持簡單:從最簡單的方案開始,只在確實必要時才增加複雜度。直接的API調度優於複雜的框架,清晰的程式優於聰明的抽象。因為每多一層抽象都會成為日後調試時的新盲區。

保持透明:明確顯示AI Agent的規劃步驟、執行日誌與決策軌跡 -- 這不是為了調試方便,也是讓用戶建立信任的前提。因為黑箱裡的錯誤一旦發生,外部觀察者既無法定位也無法糾正。

設計好工具接口(ACI, Agent-Computer Interface):ACI強調的是從Agent視角設定接口(讓AI Agent容易理解和使用),而非傳統API從工程師視角設定接口。工具的命名和參數要直觀,容易誤用的地方要從設計上讓錯誤無法發生 -- Ex.sim卡的缺角卡片讓卡片只能從一個方向插進卡槽,避免了用戶的插反錯誤;微波爐門沒關好就不加熱(應該沒有門還沒關好就能加熱的吧😅?)。
這種"用設計消除錯誤"的思路,再製造業裡也有個專門術語,叫防呆(poka-yoke),源自於豐田生產系統。設計不好的工具會讓再強的模型容易頻繁出錯 -- 因為模型與工具唯一的溝通通道就是接口本身,模糊的接口會被模型放大成系統的錯誤。

接著我們展開Harness Engineering中3個獨立但重要的主題:"模型選擇"、"編寫模式"、"護欄與安全性"。ㄟ?它們都不屬於Harness中5個要素,卻是工程實踐繞不開的決策。

如何選擇模型

在討論編排模式前,有個實際的問題:應該選擇怎樣的模型驅動Agent?

如同之前所講,模型是Agent的智能基座,選對模型往往比優化prompt更有效。由於目前模型迭代極快,我們就不推薦模型,而是選擇思路。

閉源模型:目前AI Agent開發中最常用的兩大閉源模型廠商是OpenAI(GPT/o系列)和 Anthropic(Claude 系列)。(Google真的哭暈在一邊,人走茶涼,只剩google drive的5GB很屌,gemini粉別罵我)。閉源模型通常在能力上領先,但成本較高且受限於廠商的API策略。選模型不要只看排行榜,要依自己的任務做評估。

開源模型:目前(08/31)最強開源模型與最頂尖閉源模型(Claude Fable 5、GPT-5.6 Sol)之間的差距,大約剩下 2 到 6 個月。但成本顯著低於閉源模型(這邊不探討他們是不是用蒸餾的😂)。如果你的業務廠景對模型能力沒有很高要求,開源模型是個務實的選擇(因為開源很高端的模型需要的設備也是有一定要求)但用一些中間的模型,開源成本低、可私有化部署、支持微調參數,適合對成本敏感或有數據合規要求的場景。DeepSeek、kimi、Qwen是目前能力較強的開源模型。需要注意的是,不同模型在工具調用方面能力差異大,選模型前務必實際測試。

能力之外,還要考慮模型的策略邊界:模型在基準測試中具備某種能哩,並不意味著乘載它的產品一定允許用戶調用這種能力。不同廠商會對網路安全、模型蒸餾、模型提取、隱私數據和高風險操作設置不同的策略邊界;同一個任務在聊天產品、coding Agent和API中也可能得到不同結果(你操作就知道)。因此,模型選型不能只比較準確率、價格、速度,還要在自己真實任務上測試:模型是否願意執行、接口是否暴露所需能力,以及服務條款是否允許這種使用方式。對於關鍵任務,應提前準備人工接管(直接手尻?)或其他合規模型做為替代。

絕大多數Agent需要支持思考的模型:Agent需要進行多步思考、工具選擇等複雜決策,不帶思考能力的模型在這些任務上表現往往很差。只有極少數場景例外,ex.只執行單步簡單任務,或在computer use中僅須點擊固定位置的簡單GUI操作,此時不帶思考的模型也能勝任。但只要涉及多步思考或動態決策,就一定要選擇支持思考的模型。

關注輸出速度合多模態能力:除了成本,還有兩個容易被忽略的維度。一是輸出token的速度:Agent往往需要多輪推理,每輪都要等待模型輸出完成才能進行下一步,所以輸出速度決定了端到端地響應延遲 -- 如果一個Agent任務需要20個推理,每輪慢2秒就意味多40秒(有點好笑的舉例其實)。二是多模態支持:如果你的Agent需要理解圖片、音頻或影片,多模態能力就是硬性要求,不同模型在這方面差異就很大。(基本上輕量級模型目前僅支持雙模態(文字、圖片),想要多模態就是模型要大,直觀的說)

今天講的東西真的有點多了,同樣分享一個repo-Archify
GitHub: https://github.com/tt-a1i/archify
Archify 是一個面向 AI agent 的「架構圖生成與驗證」平台:把系統意圖變成漂亮、可追溯、可分享的技術圖,而不是只是畫圖。


上一篇
[3分鐘 AI Agent導論] Day20 -- RAG -- about pre processing - chunking
下一篇
[3分鐘 AI Agent導論] Day22 --編排模式
系列文
3分鐘 AI Agent導論22
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言