昨天談一群代理。今天談回饋。
「這份寫得不太好,再改一版。」模型改了。改了之後,好了嗎?
我目前把它寫成這樣:
回饋若要指出哪個成果更符合需求,必須包含可區分相關差異的判準或訊號;反覆修改的次數本身不是改善證據。
兩個東西。訊號:哪裡不對。判準:對的樣子是什麼。回饋少了這兩樣,收到回饋的一方只能重寫,不能修正。
它也不是在說每次都要拿到外部新資訊。重看原資料、多算一次,也可能改善。未來「再想一次」很有效時,應該承認實測增益。但進步要用結果證明,不用輪數。
還有一條老規矩:沒跑過的實驗不能寫得像有結果;小樣本不能說成普遍現象。
一份四句的活動公告,三個缺陷:
| 句 | 草稿 | 真相 |
|---|---|---|
| 2 | 報名上限 40 人 | 30 人 |
| 3 | 截止日為活動前一週 | 應寫明確日期 10 月 10 日 |
| 4 | 距車站約 3 公里,步行約 5 分鐘 | 步行約 40 分鐘 |
第 1 句正確,不該動。費用、日期、地點都對。
三種回饋,一輪修改,只輸出改好的公告:
| 組 | 回饋 |
|---|---|
| E 情緒式 | 「這份公告寫得不太好,請再改一版。」 |
| S 具體指出 | 「三個地方要改:上限寫錯了;截止日要寫明確日期;距離跟步行時間對不上。」 |
| V 附依據與驗收 | 三處各附正確值與來源,並要求「其餘文字逐字不動」 |
模型是 Claude Haiku 4.5,每組四次,共十二次。
三處各自改對了沒,合計 0 到 3。第 1 句有沒有逐字保留。有沒有引入新錯:費用、日期、地點消失,或多出不在真值裡的數字。程式判。
E 沒有訊號,預期修正量接近 0,而且可能動到不該動的句子。S 有訊號沒有判準,預期能定位,但正確值只能猜。V 兩樣都有,預期 3/3、第 1 句保留、沒新錯。
材料、判準、預期,在第一次呼叫之前提交進版本控制。
| 組 | 平均修正量 | 第 1 句保留 | 新錯 |
|---|---|---|---|
| E 情緒式 | 0.0 / 3 | 0 / 4 | 4 / 4 |
| S 具體指出 | 1.75 / 3 | 3 / 4 | 3 / 4 |
| V 附依據與驗收 | 3.0 / 3 | 4 / 4 | 0 / 4 |
三組都改了一輪。改善量 0、1.75、3。
E 組的「新錯 4/4」要說明:程式把殘留的「5 分鐘」算成不在真值裡的數字。那是舊錯沒改,不是新引入的。判準寫粗了,數字照登。
落在事先寫的「示範」情形。
E 組四次都交出一份「新版」。句子重排、兩句合併、加了一句「敬請踴躍報名」。三處錯一個都沒動。第 1 句四次都被改掉。
其中三次做了一件事,我看了兩遍。草稿說 3 公里步行 5 分鐘。模型察覺這對不上。它沒有把 5 分鐘改成 40 分鐘,它把「步行」改成「計程車」「車程」「開車或騎機車」。矛盾消失了。真相是時間錯了,它改了交通方式。
它沒有判準。它知道有東西不對,不知道哪個是對的,就挑一個改法讓句子通順。這不算判準裡的新錯,因為數字都還在,但它是一種我沒預期到的抹平。
S 組知道三個地方錯了。三次直接改:
上限改成 30。猜中了。回饋裡沒有這個數字,它不可能知道。可能是常見數字的先驗。
截止日改成 10 月 10 日。這個可以從「活動前一週」推出來,不算猜。
距離那句,三次三種:改成 0.5 公里步行 5 分鐘、改成 1 公里步行 15 分鐘、改成 3 公里計程車 10 分鐘。三個都讓句子自洽了。三個都不是真相。它改了資料來消除矛盾。
第四次不一樣。它拒絕了:「缺少必要資訊,請提供報名上限的正確數字,以及正確的距離和時間。」它沒有交出公告。程式在它的拒絕文裡比對到「10 月 10 日」給了一分,把文中的編號也算成新錯,所以它在表上是 1/3、有新錯。語意上它是零修正、零編造,四次裡唯一沒有編東西的。
V 組四次輸出逐字相同,逐字等於我預期的版本。三處改對,其餘一字未動。
不是模型變聰明了。是回饋裡有它需要的全部東西:哪裡錯、對的是什麼、其他不要動。它照做。
第一,一份草稿、三個缺陷、每組四次、一輪。 多輪沒測。判準有兩處粗:殘留的舊數字被當新錯、拒絕文被當公告判。
第二,上限被猜中的原因不明。 一次猜中不代表猜得到。
第三,「改交通方式抹平矛盾」不在事先判準裡。 這是判定後的描述。
這條律是關於「必須包含」的條件。一個反例就夠:找到一種不帶訊號也不帶判準的回饋,它能穩定讓成果更符合需求。今晚 E 組四次,零修正。
另一條路:如果 E 也修對了三處,表示模型自己重看資料找出了問題,那是「再想一次」的實測增益,如實報告。今晚沒有。
每一條回饋,附一個對的樣子。
「上限寫錯了」不夠,要「上限是 30」。「距離對不上」不夠,要「3 公里步行 40 分鐘」。今晚 S 組拿到前者,三次裡三次用猜的填了後者。V 組拿到後者,四次一模一樣。差別不在模型,在你給的那一行。
紀錄表這次加的是一欄:「每條回饋有沒有附正確值」。
本文的協作紀錄是:草稿、三份提示詞、判定程式與預期在任何一次呼叫之前提交,之後未修改;十二次輸出逐字保留,判定由程式執行;「改交通方式抹平矛盾」與判準漏掉小數為判定後的描述。文章由 Claude 根據作者整理的寫作規則起草,作者尚未核對。這篇沒有做 Day 2 那種六個審查者的檢查。
下一篇談能自動做完很重要,做壞了能接回來也很重要。