iT邦幫忙

2026 iThome 鐵人賽

DAY 3
1
AI 自動化

要是有另一個我來幫我就好了:30 天把 AI Agent 訓練成我的工作分身系列 第 3

Day 03|Hermes Agent 是什麼?為什麼想用它來打造 AI 工作分身?

  • 分享至 

  • xImage
  •  

過去一年多,AI 正在經歷一個很明顯的轉變:從「跟 AI 聊天」,逐漸走向「把一件任務交給 AI 執行。」

而這個轉變,就是 AI 代理人開始變得大家都開始重視的原因。

https://ithelp.ithome.com.tw/upload/images/20260917/20105528RXT0M3UhJ0.jpg
圖:黃仁勳與 Marc Benioff 進行爐邊對談,重點討論企業內部將如何導入數以億計的專用 AI Agent | Salesforce Dreamforce 2024

從聊天問答,到真的把工作交出去

如果要找這波 Agent 浪潮最明顯的起點之一,那就不得不提到 Claude Code。

2025 年 2 月,Anthropic 推出 Claude Code。

雖然名字裡有 Code,它一開始主要面向工程師,但它展現出的工作方式,已經跟以前大家熟悉的 AI 寫程式工具完全不同。

以前的 AI coding assistant 比較像:「我寫到這裡,你幫我補下一段。」

或者:「這段程式有問題,你幫我看看。」

但 Claude Code 帶來的是另一種模式:

「這個問題交給你,你自己去處理。」

它可以讀取專案檔案、搜尋程式碼、修改內容、執行指令、查看結果,再根據結果決定下一步。

Anthropic 在推出 Claude Code 時,也直接使用了「agentic coding」這個定位。它不只是協助寫程式,而是一個可以自主執行多步驟工作的 Coding Agent。

後來 OpenAI 也沿著類似方向推出 Codex CLI,以及雲端版 Codex,讓 Agent 可以在獨立環境中處理較長時間的軟體工程任務。

所以,如果以前你認為 AI 寫程式工具是:

「我下指令,它幫我產生程式碼。」

現在則更接近:

「我給它一個目標,它自己想辦法完成。」

這是非常大的差異。

Agent 最核心的概念:Loop

那 Agent 到底多了什麼?

前一篇我們提過,Agent 和 Chatbot 最大的不同之一,就是它不只是產生答案,而是可以執行一連串行動。

這裡要介紹一個非常重要的概念:

Agent Loop。

Loop 就是「迴圈」。

一般聊天模式比較像:

提出問題 → AI 產生回答 → 結束

但 Agent 的工作方式比較像:

收到目標 → 判斷下一步 → 採取行動 → 取得結果 → 根據結果重新判斷 → 繼續行動 → 直到「完成目標」

OpenAI 的 Agents SDK 文件中,也把 Agent 的執行流程描述成類似模式:

模型先判斷下一步,如果需要使用工具,就執行工具,再把工具結果回傳給模型,重新進入下一輪判斷,直到產生最終結果。

https://ithelp.ithome.com.tw/upload/images/20260917/20105528UJe4ROQtYu.jpg

簡單來說:

Agent 不只是會做事。

它還會根據做完事情後得到的新資訊,決定下一步。

用一個生活上的例子比較容易理解。

假設我跟 Codex/Claude AI Agent 說:

幫我找今晚 7 點、4 個人的聚餐餐廳,希望環境不要太吵,可以聊天。

如果只是一般搜尋工具,它可能直接列出幾間評價不錯的餐廳。

但 Agent 的做法會更像一個真正的助理,先用這張圖來掌握全貌,然後我們再一步一步說明。

https://ithelp.ithome.com.tw/upload/images/20260917/20105528uu1yI62vjM.jpg

它可能先根據條件搜尋附近適合聚餐的餐廳。

接著,它嘗試確認訂位。

第一間餐廳看起來符合條件,但查詢後發現:

晚上 7 點已經沒有四人的位置。

這時候,一般搜尋可能就直接結束:

「沒有符合條件的餐廳。」

但 Agent 會繼續判斷:

「目前哪一個條件最重要?」

如果使用者最在意的是:

  • 可以聊天
  • 四個人一起吃飯
  • 時間接近晚上 7 點

那它可能會重新搜尋:

是否附近有其他餐廳 7 點有位置?

或者:

原本餐廳 6 點、8 點是否還有空位?

接著,它又發現某一家餐廳雖然有位置,但大量評論提到晚上尖峰時間比較吵。

於是它不只是看:

「有沒有空位。」

而是重新評估:

「這間餐廳是否真的符合使用者真正想要的結果?」

最後,它可能整理成:

  • A 餐廳:7 點有位置,環境較適合聊天。
  • B 餐廳:沒有 7 點,但 8 點有位置。
  • C 餐廳:有位置,但環境可能不符合需求。

然後把選擇權交回給使用者,問你想要哪個之後,它去訂位。

整個過程中,我們沒有一步一步告訴它:

「先搜尋餐廳。」

「現在查訂位。」

「這間不要,換下一間。」

Agent 是根據前一步得到的新資訊,自己決定下一步。

這就是 Agent Loop 的核心:

判斷 → 行動 → 觀察結果 → 再判斷。

AI Agent 不再只是工程師在用的工具

如果故事停留在 Claude Code 和 Codex,可能很多人會覺得:

「這跟我有什麼關係?」

畢竟,不是每個人每天都在寫程式。

真正讓 Agent 開始走進一般工作場景,是後來 Claude Cowork 和 ChatGPT Work 這類產品形態。

Anthropic 在介紹 Cowork 時,甚至直接描述了一條產品演進:

Chat → Code → Cowork

Chat 改變了人們取得資訊與答案的方式。

Claude Code 改變了工程師處理軟體工作的方式。

而 Cowork 則是把類似的 Agent 工作模式帶到更廣泛的知識工作。

這代表 Agent 不再只是:

「幫工程師改程式。」

而開始變成:

「幫一般工作者完成一段工作。」

例如:

  1. 整理研究資料
  2. 分析文件
  3. 準備簡報
  4. 整理報告、處理大量資訊等

OpenAI 後來也推出 ChatGPT Work,將 Agent 能力直接放進 ChatGPT 工作流程中。

使用者不只是要求:

「幫我寫一封 Email。」

而可以開始交付:

「幫我整理這個專案的背景資料,讀相關文件,分析問題,最後做一份會議簡報。」

前者比較像請 AI 幫忙完成一個小任務。

後者則更接近:

把一件事情交給 AI。

這也是為什麼現在再把 ChatGPT 或 Claude 理解成單純的聊天工具,其實已經不太準確。

它們正在逐漸演化成可以自主工作的 AI Agent。

既然 ChatGPT Codex/Work、Claude Code/Cowork 都已經可以做事,為什麼還需要 Hermes Agent

這其實也是我一開始問自己的問題。

如果我們的需求只是:「找一個很強的 AI,幫我完成工作。」

現在選擇其實很多:Claude 可以,ChatGPT (Codex) 可以,甚至,Google 陣營的 Antigravity 也可以。

那為什麼還要另外研究 Hermes Agent?

因為我真正想做的實驗,不只是找一個會工作的 Agent。

我想知道的是:

如果我每天跟同一個 Agent 工作。

我能不能慢慢把自己的:

  • 背景
  • 偏好
  • 判斷標準
  • 工作方法
  • 常用流程

這些都教給它?並讓他自己持續改進:今天教過的事情,明天還記得嗎?

這次磨出來的方法,下次還需要重新解釋嗎?

如果換了一個新的任務,它知道哪些事情跟我有關,哪些只是這一次專案的特殊情況嗎?

我想研究:一個 AI Agent 要怎麼慢慢變成「我的分身」。

這也是我最後選 Hermes Agent 作為這 30 天實驗平台的原因。

Hermes Agent 是什麼?

Hermes Agent 是 Nous Research 開發的一套開放原始碼 AI Agent 系統。

它採用 MIT License,程式碼公開。

和 Claude Code、Codex 類似,它也是讓 AI Agent 可以使用工具、執行任務、處理多步驟工作的系統。

但 Hermes 有一個很重要的特點:它不把 Agent 綁死在某一家模型供應商。

一般來說,Claude Code 背後自然是 Claude 、Codex 背後自然是 OpenAI 模型。

但 Hermes 比較像把兩件事情拆開:

第一層:

Agent 本身。

第二層:

Agent 底下使用的大語言模型。

因此 Hermes 可以接不同模型 Provider。

例如:OpenAI、Anthropic、Google Gemini、DeepSeek,甚至接 OpenRouter,或是自己透過 Ollama 等方式接上本地端 LLM 模型。

換句話說,今天 Hermes 可以使用 Claude,明天也可以換 GPT,甚至為了省錢還可以換成本地模型。

Agent 本身仍然是 Hermes,改變的是底下負責推理的大腦。

當然,這不代表不同模型結果會完全一樣 (不同模型的能力、成本、速度、Tool Calling 表現都會有差異),但至少在架構上,你不會被單一模型廠商完全綁死。

這對於想長期培養一個工作分身的人來說,這是一個很重要的差異。

Hermes 真正吸引我的,不只是它會做事

Hermes 真正讓我感興趣的是:它把一個 Agent 要長期工作的幾個重要零件,很清楚地也分層拆開。

Memory:讓它記得重要資訊

如果 Agent 每一次都重新開始,那它永遠只是一次性的工具。

但工作分身需要另一件事情:

累積。

Hermes 有 Persistent Memory 的設計。

它把不同種類的資訊分開保存。

例如:USER.md

比較偏向:「我是誰。」包含使用者背景、偏好、習慣。

而:MEMORY.md

比較像:Agent 在工作過程中累積的資訊。

例如:環境設定、專案習慣、曾經遇過的問題等

這些差異,後面會再詳細拆解。

現在先記得:

Agent 做完事情後,有沒有留下值得留下的東西,會直接影響它未來是不是越來越懂你。

Skill:讓 Agent 學會做事方法

假設我告訴 Hermes Agent:

「我寫文章習慣使用繁體中文。」

這是一個關於我的資訊。

比較像 Memory。

但如果我告訴它:

「我寫一篇技術文章時,要先研究資料,再找實際案例,用白話解釋複雜概念,最後檢查內容是否符合讀者需求。」

這已經不是單純資訊。

這是一套做事方法。

Hermes 把這類可重複使用的方法放在 Skills。

所以先用兩句話理解:

Memory = 記得什麼

Skill = 知道怎麼做

https://ithelp.ithome.com.tw/upload/images/20260917/20105528tufaQkS1bN.jpg

Context、Tools、Workflow、Automation

除此之外,Hermes 還把其他 Agent 零件拆得很清楚:

Context:讓 Agent 知道目前工作的背景。

Tools:讓 Agent 可以碰外部世界。

MCP:讓 Agent 可以連接更多系統。

Workflow:把成功的方法整理成流程。

Automation:讓流程可以在特定時間或條件下自動啟動。

如果把它畫成一張簡單的能力擴展地圖:

https://ithelp.ithome.com.tw/upload/images/20260917/20105528gBwV79Utpm.jpg

這其實就是接下來我們要來逐步拆解的項目。

所以 Hermes 比 ChatGPT Codex、Claude Code 更強嗎?

這樣的比較不太對,如果今天目標是:快速完成一個大型程式專案。

Claude Code 或 Codex 都是非常成熟的選擇。

如果目標是:直接使用一個整合好的商業 Agent 工作環境。

ChatGPT Work/Codex 或 Claude Cowork/Code 也有它們的優勢。

Hermes 的價值在於:

它提供了一個比較開放、可拆解、可控制的 Agent 系統。

當然,更多控制權也代表更多責任。

你需要面對:

  1. 模型選擇
  2. 環境設定
  3. 維護成本
  4. 了解各家模型的差異,並決定用哪個

自由度高,不代表比較簡單,之所以選 Hermes,也不是因為它最強。

主要因為:如果我要研究如何讓一個 Agent 慢慢認識我、記住我、學會我的方法,最後成為我的工作分身,Hermes 是一個很適合拆解、測試與實驗的平台。

https://ithelp.ithome.com.tw/upload/images/20260917/20105528QH0Xcz0UNW.jpg


上一篇
Day 02|ChatGPT/Claude/Gemini 已經很好用了,為什麼還需要 AI Agent?
下一篇
Day 04|打造 AI 分身前,先架設好 Hermes Agent 環境
系列文
要是有另一個我來幫我就好了:30 天把 AI Agent 訓練成我的工作分身7
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

1 則留言

0
vickihsu
iT邦新手 5 級 ‧ 2026-09-18 16:30:03

開始期待自己的AI分身了…

我要留言

立即登入留言