過去這一兩年,各家前沿生成式 AI 模型的能力早已無庸置疑。日常工作流程裡的各類任務,大多能放心地交給 Agent 執行——讀文件、查資料、寫程式碼、調用工具,甚至跨系統串聯一整段自動化流程。
但這些強大能力的背後,幾乎都架構在雲端 API 或 SaaS 服務之上。當應用走入常態運作,幾個現實問題便浮上檯面:
-
模型不斷升級,維護成本卻不減反增:對摸索期的新任務來說,模型換版是升級;但對已經穩定上線的業務流程而言,精心調教的 Prompt、Skill 定義與任務流程,往往因底層模型更新而產生行為偏差。系統越穩定、維運週期越長,「被迫跟著雲端版本跑」的維護負擔就越沉重。
-
用量與成本的不確定性:SaaS 方案有 Rate Limit 與訂閱額度限制,API 則是按 Token 逐筆計價。兩者共同的痛點在於:成本隨任務規模等比擴張,但成長曲線與穩定度卻不在自己掌控之中。
-
資料隱私與合規限制:在實際接觸企業與製造業現場時,「公司核心資料與機敏製程送上雲端」始終是一道難以跨越的紅線。無論雲端模型再強大,這類合規與資安疑慮在嚴謹情境下始終存在。
這不禁讓我重新思考:如果轉向地端,以手邊現有的硬體搭配開源 LLM,能否同樣把這些日常工作任務穩穩接下?
這正是本系列想探討的核心命題:
在有限預算、既有硬體與企業資安限制下,能否打造一套真正可工作、可控、可追溯且可監控的地端 AI Agent?
「拒當 API 韭菜」是這趟旅程的起點,但我真正想驗證的,不只是省下多少 API 費用,而是地端架構在推論效能、任務成功率、資安治理、維運成本與使用體驗之間,能否取得切實可行的平衡。
坦白說:雲端方案真的太強大了
選擇探索地端,並非否定雲端的價值。相反地,雲端架構的優勢顯而易見:
-
免除基礎設施包袱:模型推論、動態擴展、高可用備援全部交由雲端負責。
-
即時享有頂尖算力:永遠能在第一時間取用最新一代模型,無需自行追逐高階硬體或鑽研複雜的量化技巧。
-
極短的驗證路徑:只需一組 API Key 即可啟動,是快速驗證商業邏輯與打造 PoC 的首選。
探索地端架構,是為了在特定場景下尋求更合適的解法:那些需要長期穩定運行的固定任務、對資料主權高度敏感的場景,或是工程團隊希望徹底掌控底層架構時,地端就是值得深究的另一條路徑。
更純粹的工程動機則是:把黑盒子拆開,體驗一次從零搭建系統的過程。
單純串接現成 API 或雲端 Agent 平台,很多底層細節往往被封裝隱藏。這次我們將視角拉回底層,親手走過每個環節:
- 開源模型選型與地端部署
- Agent 核心架構與狀態設計
- Tool Calling 權限控制與執行環境隔離
- 任務拆解、規劃與工作流實作
只有親自走過這些踩坑過程,才能深刻理解每個架構設計背後的代價與取捨,找回親手駕馭系統的樂趣。
本次挑戰所用硬體
這次不打算額外添購昂貴的高階顯卡,而是以手邊現有資源進行極限探索:
-
主力工作站|MacBook Pro(Apple M3 Max / 64GB 統一記憶體)
擔任日常開發機,負責程式碼撰寫、輕量化 Local LLM 推論、Agent Client 與架構整合測試。
-
對照效能組|ASUS Ascent GX10(NVIDIA GB10 Superchip / 128GB Unified Memory)
感謝同事出借這台效能強勁的硬體作為 Server 級對照組。當 MacBook Pro 面臨大型模型負載或高並行推論時,將移轉至此設備測試,藉此橫向評估「筆電級」與「專業推論卡」在 Local LLM 及 Agent Runtime 上的表現落差。
兩台設備的分工與詳細規格,將在 Day 02 的硬體盤點中進一步解析。
這 30 天的目標
為了避免這系列文章淪為走馬看花的工具清單,在開始前,先幫這一系列訂定大方向目標:
-
具備實用價值的工作 Agent:跳脫「單純聊天」的玩具專案,打造能調用工具、解析文件、串聯辦公流程的實體 Agent。
-
資安邊界與治理機制:落實工具權限管控與 Human-in-the-loop 人工確認機制,確保 Agent 行為可預期、可干預。
-
效能與成本量化評估:針對速度、任務成功率、電費功耗及等效 API 成本進行實測數據對比。
-
可觀測性系統導入:建立可追蹤、可監控的系統,確保 Agent 的每一步決策與異常皆有跡可循。
30 天後,希望能為下面疑問交出一份具說服力的解答:
在有限資源與資安受控的前提下,Local AI Agent 能否真正成為走入日常辦公流程的 AI Worker?
在地端使用開源大型語言模型的方案下,到底有哪些事情可以交由 Agent 來進行協作?
擺脫 API 帳單的同時,我們究竟付出了什麼代價,又換取了哪些掌控權?