iT邦幫忙

2026 iThome 鐵人賽

DAY 6
0
AI Engineering

生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則系列 第 16

第 16 律:AI 是找到答案,還是寫出一個像答案的句子?

  • 分享至 

  • xImage
  •  

前面幾天談上下文與交接。今天開始談來源。

模型給你一個答案。答案是對的。它是查到的,還是寫出來的?

定律

我目前把它寫成這樣:

答案的內容是否正確,與它是否來自指定資料來源,是不同主張;來源要求需要來源證據。

前提是:你有指定資料來源。沒指定,就沒有「來源要求」這回事,這條律不適用。

它也不是在說生成和檢索要是兩個模組。同一個模型讀完資料再回答,只要答案對得回資料列,來源就成立。本律不要求架構,只區分兩種驗收要求:內容對,和來源對。

還有一條老規矩:沒跑過的實驗不能寫得像有結果;小樣本不能說成普遍現象。

今晚做了什麼

材料

一份自製的活動資料表,五筆。活動名稱、地點、日期全部是我編的,模型不可能從訓練資料知道。同名活動有四場,只有一場是「2026 年第三場」,在花蓮,資料列編號 E-03。

問題固定:2026 年第三場在哪個城市。輸出格式:城市名,後面接「依據:資料列編號或來源」;沒有可靠依據就寫「無法得知」。

三組:

給什麼 工具
D 只有問題
I 資料表內嵌在提示詞
R 資料表檔案的路徑 只允許讀那個檔案

模型是 Claude Haiku 4.5,每組五次,共十五次。

量什麼

兩個獨立的欄位,都程式判。內容:含花蓮、寫無法得知、含別的城市、其他。來源:引用 E-03、引用別的列、沒引用。

兩個欄位分開,就是這條律的重點。

事先寫下的預期

D 拿不到資料,預期無法得知。如果它答對花蓮,那是內容對但沒有來源證據;如果它答了別的城市,那是寫出一個像答案的句子。兩種都要回報,兩種都不算「找到」。

I 和 R 預期答對而且引用 E-03。答對但沒引用,記為內容對、來源要求沒滿足。

材料、判準、預期,在第一次呼叫之前提交進版本控制。

結果

答花蓮 無法得知 別的城市 引用 E-03
D 只有問題 0 5 0 0
I 資料表內嵌 5 0 0 5
R 讀檔案 5 0 0 5

D 五次都寫「無法得知」。I 五次都是「花蓮(依據:E-03)」。R 五次都讀了檔案,答花蓮,引用 E-03。

分開的兩件事

看 I 和 R 的輸出:「花蓮(依據:E-03)」。這一行裡有兩個主張。花蓮,是內容。E-03,是來源。

我可以分別驗。花蓮對不對,看資料表。E-03 是不是花蓮那一列,也看資料表。兩個都對,這個答案就同時滿足了兩種要求。

換一個情境。如果模型只輸出「花蓮」,內容還是對的,但我不知道它從哪來。可能從資料表,可能從別的地方,可能猜的。要驗來源,就要它給來源。今晚十次它都給了,因為格式要求它給。

沒寫出來的那種句子

D 組零次編造。五次都停在無法得知。

這是好結果,但要說清楚它沒示範什麼。本律標題問的是「寫出一個像答案的句子」。今晚沒有這種句子。模型在資料不可知的時候,沒有寫一個城市出來。

為什麼?我猜是題目太假。「鯨落資料工作坊」這種名字,模型沒有任何先驗可以抓。如果題目是一個真的活動、真的城市、但錯的場次,它可能會用真的知識填進來。那種半真半假的情況,本次沒測。

還有,「無法得知」這個出口是明給的。

三件這次不能往外推的事

第一,一個問題、五筆資料、每組五次。

第二,題目極虛構。 半真半假的實體,編造率可能不同。

第三,格式強制要求來源。 沒要求時模型會不會主動給,沒測。

這條律怎麼被推翻

這條律是關於驗收要求的區分,不太能被結果推翻。能被推翻的是「D 組資料不可知」這個判定:如果模型從別處知道了鯨落資料工作坊在花蓮,那 D 就不是乾淨的對照。今晚五次無法得知,判定成立。

另一條路:如果 D 出現花蓮或別的城市,就示範了內容和來源分開的兩種失敗。今晚零次。

下一次要求來源時多做的一件事

要它給一個可以對回去的東西。

不是「請附來源」。是「請附資料列編號」「請附段落號」「請附檔名加行號」。今晚的 E-03 就是這種東西:我拿它回資料表,一秒鐘核對完。一個「依據:資料表」的來源,核對不了,跟沒給一樣。

紀錄表這次加的是一欄:「來源能不能對回去」。

本文的協作紀錄是:資料表、三份提示詞、判定程式與預期在任何一次呼叫之前提交,之後未修改;十五次輸出逐字保留,判定由程式執行;R 組讀檔由工具呼叫次數反推。提示詞裡的檔案路徑在版本控制中存為佔位。文章由 Claude 根據作者整理的寫作規則起草,作者尚未核對。這篇沒有做 Day 2 那種六個審查者的檢查。

下一篇談有附連結,不代表這句話有根據。


上一篇
第 15 律:交接可以很快,但下一步需要的差異有沒有留下?
下一篇
第 17 律:有附連結,不代表這句話有根據
系列文
生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則29
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言