
今天講一個具體的數字:約兩千位元組。
負責大批次粗篩的那位隊友,工單長度超過這個量級,行為就開始變了。線不是刀切的,但量級是實測出來的。他還是會做事——把該讀的檔案全部讀完,一個不漏。然後結束,不吐結論。
不報錯,不抱怨工單太長,就是安靜地做完前半段,把後半段忘了。
一開始我以為是模型壞了(前一天才遇過真的壞掉的,症狀類似)。但換了模型還是一樣,那就不是模型的問題,是我餵的方式。
我做了個對照實驗。同一份複驗工作,裡面有四個獨立的問題。
第一次,四題寫成一張完整工單丟給他。結果:讀完所有相關檔案,零結論。
第二次,拆成四次呼叫,一次只問一題。結果:四題全部答對,數字精確。
同樣的模型、同樣的問題、同樣的檔案。差別只在一次餵多少。
這位隊友的手感紀錄上後來多了一行:中文處理沒問題,但上下文一長就開始漏內容。
要注意的是「漏」的方式。他不是整個垮掉——垮掉你看得出來。他是漏掉一部分、做完剩下的,然後用做完的那部分呈現出「我做完了」的樣子。
四題的工單漏掉結論那段,你拿到的是一個讀了很多檔案的空報告。十題的工單漏掉第三和第七題,你拿到的是一份看起來完整的八題報告,而你要自己數過才知道少了兩題。
這條寫進了能力表的手感欄。實際派法就是一個迴圈,一次一題:
for q in q1.txt q2.txt q3.txt q4.txt; do
opencode run -m opencode/<模型> "$(cat $q)" > "ans_${q%.txt}.log"
done
大批次的活照樣派給他,但拆開餵:
・每次呼叫只放一個問題
・每個問題自帶完整背景,不依賴「上一題講過」
・回收時逐題核對,不是看整體像不像做完了
第三點是被另一位隊友教會的。有一次同類的活我讓兩位都做,一位的結果是「總和正確,但個別數字沒逐一核實」,另一位分段餵的結果是每個數字都對。總和對是會騙人的,錯誤有時候剛好抵銷。
這位隊友我一開始的定位是「便宜大批次粗篩」,講白了就是期待不高。
但一題一問之後,他反覆做出超出定位的成績。某次架構掃描的複驗,他兩輪各獨立找出一條別人都沒發現的關鍵推翻。另一次要逐頁核對一份十六條標準的官方文件,他真的一頁一頁抓下來,交回原文引述加逐條網址,品質跟獨立跑的完整流程對得上。
便宜的不是能力,是我原本餵他的方式配不上他的能力。
工具的上限有時候不在工具身上,在使用方式上。這句話很像廢話,但兩千位元組這個具體的數字讓它不是廢話,你得真的去找到那條線在哪裡。
明天講派工的另一半:授權。派出去的活,他可以動到什麼程度?