Week 4 開場:最貴的一層
L1 零誤差但只抓已知,L2 抓語意但只回一個分數。Day 21 結尾留了一個出口:L2 分數落在 t_low 與 t_high...
本文所有資料皆為合成資料。
從單題到全貌
昨天做完了出題與批改。但一題一題答完,如果沒有累積,這個系統就只是一個線上題庫。
真正的價值在於:把每一次答錯,累...
「都是自己人的 Agent,應該可以信任吧」
這句話是這個陷阱的根源。多 Agent 系統設計時,很容易預設「系統內部的 Agent 之間可以互相信任」——Ag...
今天要補的,是 v1 沒寫到的攻擊面Day 16 的回歸測試留下了一個很清楚的結論:v1 修好了 Day 13 的兩個身分覆寫破口,也沒有讓任何舊題目退步,但情...
蠻橫咒的受害者表面上行為看起來一切正常,但實際上他的行為已經完全被其他人控制了。唯一能意識到他已經失去自主意識的,大概只有相當親近的家人、朋友。
有些時候,員工...
Core Question
要重建 Agent 決策與 side effect,哪些 evidence 必須跨 identity、delegation、poli...