昨天教會這套方法:同性質的證據只算一票。今天問一個更麻煩的問題——就算證據性質不一樣,如果開口的那幾個人彼此都聽過對方怎麼講,這幾張票還算獨立嗎?
1907 年,Galton 在市集讓將近八百個路人猜一頭牛的重量,群眾估計的中位數幾乎命中靶心。一百年後,美國情報圈辦了一場預測錦標賽,結果讓官方有點難堪:沒有機密權限的志願者,把很多人的預測合起來,贏了手上握著機密的分析師。普通團隊贏過散裝的群眾,預測市場贏過團隊,受過訓練的預測員團隊再贏過市場——一路往上,靠的都是同一件事。
那件事是獨立。八百個路人各自估算,沒有先跟隔壁討論;一旦互相打聽,一千個獨立的估計會縮水成一個回音。問十個「都聽過你版本故事」的朋友,得到的不是十個意見,是一個意見的十次回聲。
今天要做的,是把「先各自寫下來再開口」做成流程。而且這一支有一個別的 skill 沒有的條件:在這個環境裡,「獨立」可以做在結構上——每個評審是一個獨立的對話,彼此看不到;對照組則刻意讓評審依序看到前面的人怎麼答。兩組的散布擺在一起看。
出處:Galton, F. (1907). Vox Populi. Nature, 75, 450–451. https://doi.org/10.1038/075450a0
Tetlock, P. E., & Gardner, D. (2015). Superforecasting: The Art and Science of Prediction. New York: Crown.
從 D12、D13 挑三條被後面接手最多的主張,各做一份題目:主張一句話(中性措辭)、證據清單(照 D12、D13 查出來的寫,含二手、未取得、同源合併後的票數)、一句「如果錯最可能錯在哪」。不附我們自己的判定。
獨立組:五個評審同時開、互相看不到、只拿到題目,各自寫下 0–100 的機率跟一句理由。回音組:同樣五位、同樣的題目,但依序——第二位看得到第一位的答案,第三位看得到前兩位。五個數字取中間那個,另外看散得多開。彙整前查獨立性,任何一位破功整筆標記。
這個 skill 的 prompt 這樣下:
幫我建 D14 的 skill。
它相信一件事:八百個路人各自猜一頭牛有多重,中間值幾乎命中,前提是各自猜、沒有先討論。
一旦互相打聽,一千個人會縮成一個回音。我說「幫我分開問」的時候,它從前兩天的表裡挑三條被後面引用最多的主張。
每條做一份題目:主張一句話、證據清單照查出來的寫、一句「如果錯會錯在哪」。
不附我們自己的判定。
然後開五個彼此看不到的評審,各自用 0 到 100 寫下這條站得住的機率,加一句理由。
寫完才彙整。
再開一組對照:一樣五位,但依序看得到前面的人怎麼答。
用中位數彙整,看散布。
發現評審有互相聽過的,整筆標成破功,不能悄悄留用。存到
作業區/D14/。
把這句話直接丟進 Claude Code:
幫我分開問
它挑的三條:六步驟循環(D02 就在,D03、D04、D06 接手,兩篇專欄再用——D06 七組配對的環節材料就是它)、「情緒勒索」這個詞被濫用(對照用的一條,D13 留住的三條裡最硬的一條,三筆分屬三個平台三個作者、跨兩種性質)、沒有裁定機制(兩篇專欄份量最重的支點,外部證據 0 筆)。出題的那一支自己列了幾處會帶方向的句子,最強的一句是題目三末尾「檢索紀錄裡沒有一組關鍵字去查有沒有申訴或複核程序」——是事實,但會把人往低分帶。
十位評審跑完:
| 主張 | 獨立組中位數 | 獨立組最低–最高 | 回音組中位數 | 回音組最低–最高 | 目前狀態 |
|---|---|---|---|---|---|
| 一 六步驟循環 | 58 | 40–70 | 72 | 70–78 | 暫存 |
| 二 詞被濫用(對照) | 75 | 66–85 | 85 | 82–92 | 可信,D13 留住 |
| 三 沒有裁定機制 | 20 | 12–25 | 18 | 15–20 | 暫存,外部 0 筆 |
這一輪獨立組的散布真的開了。 題目一五個人從 40 到 70,跨 30 分,沒有重複值——這證明同一個模型不會逼出一致,「十位是同一個模型所以散布小」單靠這個解釋不夠。
回音組三條全部收窄,最低到最高的距離 30 縮到 8、19 縮到 10、13 縮到 5。它寫了一句:分歧沒有被解決,是不再被寫出來。 題目一被前面的人帶著走,帶得最明顯——回音組的下限 70,正好等於獨立組的上限;獨立組五位有三位在 60 以下,回音組沒有一位低於 70。
回音組從第幾位開始靠,三條都抓得到證據。題目一第二位:回音組第二位造出「主張只是『中文論述裡存在這個框架』」這個切法——題目裡沒有、獨立組五份裡只有一份自己找到——第三、四、五位用同一組詞原樣傳下去,少數讀法從五分之一變成五分之四。題目二第三位,證據最硬:第三位寫「故不給到 90 以上」——這句話只有看得到前面的 90 才寫得出來。題目三一路往下:20、18、18、15、15,沒有新材料進來,形容詞一路加碼:無→純粹的→教科書等級的→典型。
獨立性:未破功。最硬的一個反過來的證據在題目三——「這條主張是這條線自產的」這件事,獨立組五個人造了五種不同說法(自己出題自己判、自己說自己對、未被直接驗證、自證而非查證、自證的結構性風險),回音組同一個位置是同一個詞被傳四次。
那條對照用的主張部分起作用:十份回覆的排序零例外,全部二>一>三,等於 D12、D13 的證據強度順序。但不足以單獨證明辨別力——十份裡六份明白拿「這句話門檻低、容易成立」當給分理由,「材料最硬」跟「句子最好成立」這批資料指同一個方向,分不開。下次要挑材料硬、句子寫成硬斷言的,讓兩者反著走。
出題那一支預先擔心的引導,十份回覆裡差不多九成真的出現了。最該記的一項:題目三的主張句是「這個詞有定義、有分型、有時間軸、有話術對照表,就是沒有人可以判」——十份回覆沒有一份碰過前半,十位全部只判後半。句式不是讓人打折,是讓前半整個消失。
十位評審一致指出、也是這條線從來沒做的一件事:沒有拿「有沒有申訴、複核、可駁回的程序」這組關鍵字去查過。
下一篇:別數誰支持你,數哪條證據能刷掉誰。