AgentDojo 專為評估與測試 Agent 安全性所設計的動態開源框架。本文深入解析 AgentDojo 主要模組,並分享如何直接透過 Python 程式碼...
上篇文章提到的查詢模組,從 dir(agentdojo.benchmark) 的輸出可以看到,這個模組匯集了任務執行函式、結果資料結構、序列化工具,以及多種例外...
原本都是在 code 完成,後來發現透過 Terminal 就能查詢 AgentDojo Benchmark 指令所提供的參數: python -m agent...
操作後發現 OpenAI API 需要付費 credits,直接改用 Ollama 的免費模型,讓它直接在本機執行。下載 Ollama 後在 Terminal...
完成 AgentDojo 的環境建置後已經可以使用 Ollama 在本機執行 Qwen3 4B,並讓 AgentDojo 透過 Local LLM 與模型建立連...
目前架構: ┌─────────────────────┐ │ AgentDojo │ │ Benchmark Task │ └─...
今日主要目標是進一步確認 AgentDojo 使用 Qwen3:4B 時,為什麼 User Task 的執行結果一直維持 0%。 之前測試已經確認,Ollama...
切換至 Qwen3:8B,4B 模型容易出現 Function Calling 格式錯誤或無法正確選擇工具的情況。今天正式將模型提升到 8B,希望能更穩定地完成...
目前使用 Windows、VS Code PowerShell 以及 Python .venv 環境執行 AgentDojo。Ollama 運作於本機 1143...
重新確認 AgentDojo 與 Ollama 基本環境 首先針對先前發生的 Connection error 進行確認。執行 user_task_1 時,出現...