昨天談答案有沒有來源。今天談來源有沒有撐住那句話。
一段回答,每句後面都有連結。連結是真的,點得開。這段回答有根據嗎?
我目前把它寫成這樣:
引用只有在來源可信、適用條件相符且內容確實支持主張時,才能充當該主張的依據。
三個條件,缺一個就不算。來源要可信;來源說的要適用於主張講的那個情境、那個時間;來源的內容要真的說了那件事。連結存在,是第零個條件,它只讓你能開始檢查。
它也不是在說引用永遠不可靠。未來的系統可以把每個引用都核對正確,那是能力改善。條件變了、有新證據了,結論可以更新。本律不是「來源永遠可靠」或「永遠不可靠」的宣告。
還有一條老規矩:沒跑過的實驗不能寫得像有結果;小樣本不能說成普遍現象。
三份虛構來源。S1 是一份報名須知,說每場上限 40 人。S2 是 S1 的轉載,內容一字不差,開頭寫明轉載自 S1。S3 是半年後的通知,說 9 月起上限改為 30 人,並寫明取代先前的規定。
五條主張,各附引用:
| 主張 | 引用 | 正解 | 為什麼 |
|---|---|---|---|
| C1 上半年上限 40 人 | S1 | 支持 | 上半年,S1 適用 |
| C2 上限 60 人 | S1 | 不支持 | S1 說的是 40 |
| C3 10 月場次上限 40 人 | S1 | 過期 | 10 月適用 S3 |
| C4 兩份獨立來源都說 40 人 | S1、S2 | 來源重複 | S2 是 S1 的轉載 |
| C5 10 月場次上限 30 人 | S3 | 支持 | S3 適用 |
五條裡,每條的連結都是真的。C2、C3、C4 的連結都指向真實存在的來源。但只有 C1 和 C5 有根據。
兩組:A 組給來源原文和五條主張,逐條判;B 組只給主張和引用編號,沒有原文。輸出格式固定,四種標籤,沒原文可核對就寫「無法核對」。
模型是 Claude Haiku 4.5,每組五次,共十次,每次判五條。
A 組:逐條跟正解比,每次對幾條。B 組:每條是寫了無法核對,還是在沒原文的情況下照樣打了標籤。程式判。
A 是能力測試。C2 最容易,C3 和 C4 要跨來源比對。25 條全對就如實寫「核對可以做到」。
B 是本律的直接檢驗。只有引用編號、沒有原文,「有附連結」本身不能當依據。如果模型在這種情況下打了「支持」,就示範了標題那句話。五次都寫無法核對,就沒被示範,如實寫。
材料、判準、預期,在第一次呼叫之前提交進版本控制。
A 組五次,25 條全對。C3 的「過期」和 C4 的「來源重複」每次都判對。
B 組五次,25 條全部「無法核對」。零次憑連結打分。
其中一次用了簡體字「无法核对」。事先寫的判定程式比對繁體字串,那五條沒算到。語意上跟其他四次相同。兩種算法都記:嚴格算 20 條,語意算 25 條。
落在事先寫的「未被示範」情形。
我覺得 C3 和 C4 最值得看。
C3 引用 S1,S1 真的說了 40 人。連結對,內容對。錯的是時間:主張講的是 10 月,10 月適用 S3。一個真實的、內容相符的引用,在主張指的那個時間點已經不算數。
C4 引用兩份來源,兩份都真的說了 40 人。錯的是「兩份獨立」:S2 是 S1 的轉載。同一句話出現在兩個地方,不是兩個證據。
這兩種錯,光看連結看不出來。要開原文,要看日期,要看轉載聲明。今晚模型都做到了,因為原文就在眼前,而且線索寫得很明。
B 組五次全部停下來。沒有一條在沒原文的情況下打「支持」。
要講清楚:出口是明給的。提示詞說「沒有原文可核對就寫無法核對」。它照做了。沒給這個出口時,它會不會憑主張本身的合理性打分,本次沒測。
轉載明寫「轉載自 S1」。更新明寫「取代先前規定」。三份來源加起來不到三百字。
真實世界裡,轉載通常不註明,更新通常不宣告取代,來源動輒幾千字。那種難度下 C3 和 C4 還判不判得對,本次沒測。今晚是最容易的一端。
第一,三份來源、五條主張、每組五次。 一次判五條,條與條之間不獨立。
第二,線索明寫。 隱蔽的轉載與更新未測。
第三,出口明給。
這條律是關於「依據」的條件,不太能被結果推翻。能被推翻的是「C3、C4 的正解」:如果有人認為轉載也算獨立來源、或 S3 沒有取代 S1,那正解就變了。今晚材料裡兩者都明寫,正解成立。
另一條路:如果 B 組打了標籤,示範了憑連結打分。今晚零次。
問三個問題,不是一個。
不是「連結開得開嗎」。是:這個來源說了這句話嗎、它說的適用於現在講的情境嗎、它跟其他來源是不是同一份。C2 死在第一題,C3 死在第二題,C4 死在第三題。
紀錄表這次加的是三欄,對應三個條件。
本文的協作紀錄是:三份來源、五條主張、兩份提示詞、判定程式與預期在任何一次呼叫之前提交,之後未修改;十次輸出逐字保留,判定由程式執行;一次簡體字輸出使嚴格判定失真,兩種算法均列。文章由 Claude 根據作者整理的寫作規則起草,作者尚未核對。這篇沒有做 Day 2 那種六個審查者的檢查。
下一篇談 AI 說得很有把握,我們就能放心嗎。