至此,我們已經把 Hermes Agent 安裝完成,也知道 AI Agent 和一般聊天型 AI 最大的差異。但是知道概念,跟真的使用是兩件事情。很多人在開始用 Agent 時都會遇到一個問題:「所以我現在到底可以交給它做什麼?」
舉個例來說,如果只是想找台北有哪些好吃的健康餐廳,那ChatGPT、Gemini 這類聊天型 AI 已經可以去做出不錯的搜尋結果,然後回答我們。
但如果今天我的需求不是只是找一間餐廳,而是希望週末不要一直坐在家裡:我想騎 U-Bike、打桌球、吃健康一點,也想安排一個可以放鬆、又有運動效果的週末,最後還希望 AI 整理成一份可以保存的 Word/PDF 文件,當作是我的行程手冊呢?
這時候,問題就開始變得多面向了,因為這已經不是「回答一個問題」,而是一個需要規劃、判斷、整理與執行的任務。這篇來試試真正把一件比較大的任務交給 Hermes Agent ,並再疊加更多要求上去吧!
我們先不要急著說 Agent 比 Chat AI 什麼都好棒棒,因為這樣不公平。如果我丟給聊天型的 AI,例如 Gemini、ChatGPT:
幫我規劃一個健康的週末行程。
它也可以產生一份看起來不錯的答案,例如星期六早上騎車、下午打桌球、晚上吃健康餐,星期日安排散步或戶外活動。這份結果可能已經比很多人自己規劃得完整。
所以問題不是:「Chat AI 能不能做到?」答案是可以。真正的差異在於:當需求開始增加、任務開始變複雜時,我們需要的是一個答案而已,還是一個能協助完成事情的夥伴?
一開始,我給 Hermes Agent 的需求其實很簡單。我沒有設計一個很複雜的 Prompt,而是像平常交代事情一樣描述需求:
我想安排一個健康的週末生活計畫提案。
- 我平常工作比較忙缺乏運動,希望週末可以多運動、走走,也吃得健康一點。
- 我喜歡騎 U-Bike,也喜歡打桌球。
幫我規劃星期六、星期日的行程,包含運動、飲食與適合走訪的地方。
要整理成一份 Word 文件
看起來只是幾句話,但是想想,如果真的要完成這件事情,背後其實包含以下步驟:
AI Agent 會像進行思考、規劃、執行,我常會去「偷看」它怎麼想事情,寫了什麼程式去執行什麼事,蠻有趣的,有時也會給我一些啟發:
這就是 Agent 和聊天機器人的第一個差異:Agent 面對的是「目標」,而不是單純的「問題」:
目標 → 拆解任務 → 執行步驟 → 執行 → 產出成果

生活中其實有很多事情都是這樣。例如,我要準備一場家庭旅行。表面上看起來只是:「幫我安排旅行。」但真正開始執行時,需要處理:
旅行規劃不是找到十個景點就結束,真正困難的是如何把這些資訊組合成一個可以執行的行程。週末健康計畫也是一樣。
Hermes Agent 需要先理解:我的目標不是「找景點」,而是「幫我設計一個符合我的生活習慣,又能真的執行的週末。」這種從目標拆解工作的能力,就是任務規劃(Task Planning)。
看看他這一輪下來,所產出的成果:
還不賴吧?是一個的確可以拿來使用的計畫。
後來我又增加了一個需求:假設我的住的地方是在中永和的景安站附近,希望 Hermes 幫我重新規劃路線。這時候它不只是需要知道「附近有哪些地方」,而是要思考哪些地方應該排在一起、先去哪裡、下一站去哪裡,以及怎麼移動比較順。
例如,上午騎 U-Bike、中午安排健康餐、下午打桌球、晚上散步。如果每個地點都很好,但彼此距離很遠不順路,那最後就還是會變成一個不好的行程。
於是我下指示提示詞
假設我住家就在捷運景安站旁邊
幫我把在規劃里面提到的路線,用 Google Map 把這些地點給照順序全部串起來,二天共二個路線行程。方便我之後知道可以怎麼走,打開文件點擊就可以用。
Hermes 不但幫我用 Google Map 去把這些地點以比較順路的地理順序串起來,並設定成一個連結,讓我在 Word 中點擊這個連結,就可以直接導航。


好的規劃不是把好的選項全部放進去,而是在限制條件下,找到最適合的組合。這也是 Agent 和單純搜尋工具的差異:搜尋告訴你「有哪些選擇」,Agent 協助你「怎麼完成目標」。
回顧一下,在這個例子裡,其實包含不同類型的工作:
如果全部自己做,就像以前規劃旅行:開很多分頁、查很多資料、複製貼上、慢慢整理。Agent 的價值,是把這些步驟串起來。
Agent = 大腦 + 工具 + 執行流程
模型負責理解與判斷。工具負責處理外部工作,例如透過 MCP、API、Browser Use、Computer Use 等方式連接不同系統。流程負責把事情一步一步完成。
完成後,我得到的不只是聊天室裡的一段文字,而是一份完整的週末健康生活計畫,內容包含:
這個差異看似很小,但實際使用時差很多。因為以前在 Chat 中的答案通常看完就結束,甚至淹沒在來回對話之中。
但成果可以直接留在本機/手機裡、修改、再次使用。
整理一下今天這個案例:
| Chat AI | Agent | |
|---|---|---|
| 回答問題 | 可以 | 可以 |
| 提供建議 | 可以 | 可以 |
| 理解目標 | 可以,但通常停留在表面需求 | 可以進一步理解背後真正目的與限制 |
| 拆解複雜任務 | 通常需要人與 AI 來回對話,協助拆解 | 可以根據目標自動拆解成多個執行步驟 |
| 執行多步驟流程 | 較弱 | 可以規劃並自主執行完整流程 |
| 整合不同能力完成成果 | 較弱 | 可以透過 MCP、API、Browser Use、Computer Use 等能力串接不同工具完成任務 |
要注意一下,這裡不是說 Chat AI 沒有價值。聊天型 AI 其實還是很適合:
我自己也還是會用。
AI Agent 則是更加適合:
以前,我們有的是可以回答問題的 AI,然後我們自己需要根據他回答的,自己動手完成。
今天,我們把一個有明確目標的任務交給 AI,讓它協助完成一件事情並產出實際結果。這個差異,就是 AI 從「出張嘴工具」走向「動手做」的開始。