iT邦幫忙

2026 iThome 鐵人賽

DAY 10
0
AI Engineering

3分鐘 AI Agent導論系列 第 10

[3分鐘 AI Agent導論] Day10 -- 上下文:Agent的眼睛

  • 分享至 

  • xImage
  •  

上下文是AI Agent在每個決策點能看到的全部訊息。
就像一個人在做決策時需要看到桌上攤開的所有資料,有任務說明、參考手冊、之前的溝通紀錄、最新數據等..
AI Agent的上下文窗口(context window)就是它的"視野"。
從API的視角出發(可以想像成使用Chatgpt,你輸出指令,她思考後回覆問題),每次調用LLM時的上下文有以下5個部分組成:

系統提示詞(System Prompt):與用戶輸入的提示詞不同,系統提示詞是由開發者編寫,在整個對話過程中保持不變,相當於AI Agent的"職位說明書",定義了它的身分、權限和準則,也是等級最高的prompt。通過Prompt engineering設計系統提示詞,我們可以塑造AI Agent的工作方式。系統提示詞中還會包含跨對話的用戶記憶(用戶偏好、歷史資料、背景設定等個人化訊息)和動態注入的環境狀態。(這部分應該挺有感的,記得在去年Gemini改版時加入這個功能時風生水起,反倒現在路邊一條....

工具定義(Tool Definitions):聲明AI Agent可用工具的名稱、功能描述和參數格式。沒有工具定義,AI Agent就無法辨識和調用任何工具

用戶消息(User Messages):來自用戶的輸入。用戶消息中還可能包含通過RAG動態檢索引入的外部知識(覆蓋訓練數據截止後的訊息或私有領域知識)

模型回復(Assistant Messages):模型之前的生成回覆,最多包涵3個部分:思考過程(reasoning,用於保持思維的連貫性和決策的可解釋性)、文本內容(content,對用戶的回覆)和工具調用請求(tool_calls,即AI Agent採取行動的方式)。在一次具體的回覆中,3者不一定同時出現。例如:AI Agent決定調用工具時通常只有 reasoning + tool_calls,給出最終回答通常只有 reasoning + content。

工具執行結果(Tool Results):AI Agent框架執行工具後返回的結果。這些結果是AI Agent下一步思考的依據,也讓它能夠從執行結果中學習,避免重複錯誤。

前兩項(系統提示詞 + 工具定義)是靜態前綴;後三項(用戶消息 + 模型回覆 + 工具執行結果)是隨交互不斷增長的動態消息歷史。這五個部分共同組成了LLM每次推理的上下文。

工作流 agent 適合多模態、workflow、長時間工作
GitHub: https://github.com/langchain-ai/langgraph


上一篇
[3分鐘 AI Agent導論] Day9 -- 工具:Agent的手腳
系列文
3分鐘 AI Agent導論10
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言