Day 16 檢查的是模型送往工具的參數。工具跑完之後,資料還會反方向流回 Agent:tool result 進入 context,模型看完再決定下一步。
這...
Agent 說「做完了」,是它自己說的。要不要信,交給一支它改不到的程式:在它收工那一刻,照派工時寫好的驗收條件重跑一次,再看它改了哪些檔。對不上就退回去;做...
今天不寫新東西,做三件事:重新把架構講一次、列出這 30 天裡驗證了哪些東西,最後講講心得跟接下來打算怎麼走。
重新講一次架構這座 SOC 分三層,Day 3...
Week 4 開場:最貴的一層
L1 零誤差但只抓已知,L2 抓語意但只回一個分數。Day 21 結尾留了一個出口:L2 分數落在 t_low 與 t_high...
本文所有資料皆為合成資料。
從單題到全貌
昨天做完了出題與批改。但一題一題答完,如果沒有累積,這個系統就只是一個線上題庫。
真正的價值在於:把每一次答錯,累...
「都是自己人的 Agent,應該可以信任吧」
這句話是這個陷阱的根源。多 Agent 系統設計時,很容易預設「系統內部的 Agent 之間可以互相信任」——Ag...