「我們每次發文前都會請人再看一遍,怎麼還是會漏掉不該出現的東西?」
這是很多團隊在導入某種內容規範(不管是去識別化、格式規範、還是某種命名慣例)之後,遲早會問出來的問題。答案往往不是「複查的人不夠認真」,而是這一類問題本身,不符合人腦掃視時會自然注意到的模式——今天用一個具體案例,走一次「某類規則從靠人工每次都漏,到寫成自動化檢查工具」的完整過程。
情境是這樣:一個團隊訂了一條規則——所有要對外發布的內容,不能出現某一類特定格式的識別字串(可能是內部代號、可能是某種命名模式)。這條規則寫進了流程文件,每次發布前也確實有人會重讀一遍內容。
但問題還是持續發生:漏掉的不是那種一眼就能看出來的明顯案例,而是藏在一長串正常敘述中間、格式上跟周圍文字很像、讀起來完全不突兀的那種。複查的人不是不認真,是人在閱讀大段文字時,注意力會自然被「語意」牽著走——讀者在乎的是「這句話講不講得通」,而不是「這個詞的格式符不符合某個規則」,這兩件事需要的注意力模式完全不同。
人工複查依賴的是「這裡感覺怪怪的」這種直覺,但某些問題的設計就是不會讓人產生這種直覺——它們讀起來完全通順,甚至讓內容看起來更具體、更可信,複查的人反而更不會多想。這正是最危險的地方:越是讀起來自然的識別資訊,越容易被複查漏掉,因為它沒有觸發任何「這裡需要多看一眼」的訊號。
這跟「這句話語意通不通」是兩個完全獨立的判斷維度:一句話可以語意完全通順,同時又命中了不該出現的格式規則。人腦在閱讀時預設是做前者的判斷,不會主動切換到後者,除非刻意訓練自己用另一種方式重新掃過一遍——而這種刻意切換,正是最容易被跳過的一步,尤其是在時間壓力下,或是已經讀過同一份規則很多次、注意力早就鈍化的情況下。
有人提議:既然這類問題的判斷標準是明確的(符合某種格式、符合某個已知清單),那就不該靠人工每次重新判斷,該寫成一支可以直接執行的檢查工具——把「這個字串符不符合某種已知的識別格式」這件事,變成程式碼可以窮舉比對的問題,而不是靠人一段一段讀過去判斷。
工具寫出來、第一次拿去掃過去已經發布過、也已經被人工複查過好幾輪的內容,結果立刻抓到一個先前所有複查都沒抓到的案例——不是因為那個案例特別隱蔽,而是因為它剛好符合前面講的那個特徵:語意通順、格式上不突兀,人工複查的注意力自然被語意帶走了。
用一組對照來看這個差異:
❌ 只靠人工複查,依賴「感覺哪裡怪怪的」:
複查者讀完整段內容,判斷「讀起來很正常,沒問題」
→ 判斷依據是語意通不通,
但識別資訊的問題根本不在語意層次,
複查者的注意力從一開始就被引導去判斷錯的東西
✅ 明確判斷標準寫成工具,人工複查退居第二關:
先跑自動化工具,掃出所有符合已知格式的候選項目,
再由人工針對這份候選清單逐一確認要不要修改
→ 判斷標準從「讀起來順不順」換成「符不符合已知格式」,
工具負責窮舉比對,人負責判斷候選項目裡哪些是真的要改
這正是這個系列反覆講的模式:不是要求人變得更細心、更有經驗,而是把判斷標準從「依賴直覺」收斂成「可以被程式邏輯窮舉比對」的具體規則。 人工複查不會消失,但角色從「第一線的偵測器」變成「候選清單的最終判斷者」——這兩個角色需要的能力完全不同,前者容易疲勞、容易被語意帶偏,後者則是人真正擅長的:對著已經篩選過的候選項目,做需要理解上下文的判斷。
這支工具寫出來的第一版,只涵蓋了團隊當下已知的識別格式。後續每次發現一個新的、工具還抓不到的案例,就把對應的規則加進工具的判斷清單——工具本身不是一次寫完就結束,而是隨著實際踩過的坑持續變得更完整。這也呼應了 Day 15 講過的分界:工具負責窮舉比對、持續累積規則庫,人負責判斷候選清單裡哪些是真的問題、要怎麼改。
第二部(Day 8-16)從記憶系統的四種類型(Day 8)開始,講到 feedback 記憶怎麼從被糾正變成規則(Day 9-10)、記憶會過期的風險與怎麼設計驗證紀律(Day 11-12)、CLAUDE.md/Skill/Memory 三層分工(Day 13-14),最後收在把機械式檢查寫成可執行工具(Day 15-16)。這幾天想傳達的核心是同一件事的不同樣貌:讓 AI(或人)依賴的判斷依據,從「記性」「直覺」這種容易失效的東西,換成「可以被明確驗證、可以持續累積」的具體機制。
回想你的團隊有沒有一條「每次都有複查,但還是偶爾會漏」的規則?那類漏掉的案例,有沒有一個共同特徵——是不是都剛好符合「讀起來很自然,不會引起注意」這個模式?
明天要進入第三部:多 Agent 協作的坑。第一篇要講「為什麼要委派給獨立 agent」——這件事其實不只是「分工」這麼簡單。