iT邦幫忙

2026 iThome 鐵人賽

DAY 2
0
AI Engineering

生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則系列 第 2

第 2 律:「這篇是 AI 寫的」到底告訴了我們什麼?

  • 分享至 

  • xImage
  •  

昨天的文章分三步寫成:我用自己整理的寫作規則讓 Claude 起草,交給另一家的模型潤稿,最後逐句核對數字、引文和台灣用語,修改定稿。

如果文末只寫「本文使用 AI 協助」,你能知道多少?哪個模型起草、拿到什麼資料、我改了三成還是三個字,這個標籤都沒說。

鐵人賽簡章第 3 頁的「發文規範」,有這兩段話:

本競賽可使用生成式人工智慧等新興科技,唯發文內容仍應遵循以下發文規範:

發文內容以自創為限,且不得有抄襲、模仿、頂用他人名義等情事。

可以用 AI,又要自創。哪種用法算自創?簡章沒有進一步界定,光說「用了 AI」也回答不了。至少得先知道,AI 和人各做了什麼。

定律

只標示「AI 生成」,無法唯一辨識所使用的模型、資料、工具與人工處理流程。

這裡先用「AI 生成」指整段由模型產出,「AI 協助」指人主導、模型在某個環節幫忙。一句提示直接產文、給資料再產文,都可以叫「AI 生成」;人列論點請模型擴寫、寫完初稿請模型潤飾,也都可以叫「AI 協助」。名字相同,做法卻可能差很多。

除非大家事先約定這個標籤只能用在某一套完整、固定的流程上,否則讀者光看標籤,無法知道文章是怎麼做出來的。平台若有這種約定,讀者可以查;沒有,就得由作者交代。即使以後更多步驟都能自動完成,這個問題還在:同樣叫「AI 生成」,背後用的模型、資料和工具仍可能不同。

這件事本身不需要實驗證明。不過,流程不同,成品真的會有差別嗎?如果有,讀者能不能從內容看出用了哪種流程?今晚我想試的是這兩件事。

今晚的小實驗

題目固定:「為第一次參加鐵人賽的新手,用繁體中文寫一段約 300 字的說明,介紹 2026 鐵人賽的發文規範。」

選這一題,是因為回答能逐條對照官方原文。2026 年的簡章我是九月才拿到的,模型看過沒有,我不知道。如果回答混入舊規則,或寫出簡章沒有的規定,就能查出來。

我讓模型用兩種方式作答,分別記為 F1 和 F2,方便後面對照:

  • F1 只給題目,讓模型直接寫。
  • F2 除了題目,再給簡章「發文規範」的原文,要求以原文為唯一依據。

模型選 gpt-6-astra 和 Claude Haiku 4.5,來自兩個模型家族。每個模型各跑兩種流程,每種只呼叫一次,共四段成品。四段都可以標成「AI 生成」。

評分挑出六個可查核項目:可用生成式 AI、繁體中文為主、每篇多於 300 字、引用不逾全文三分之一、切題不灌水、自創不抄襲。每項判「對、錯、未提」,另外計算成品寫了幾條整本簡章都沒有的規定,記為「捏造」。判定由 Claude 對照簡章完成,我沒有逐格核對。

這裡先交代一個資料缺漏:F2 實際拿到的是該節七條規範中的前五條,少了當日修改與賽後刪文兩條。六個查核項目都在前五條裡,所以就算六項全對,也不等於完整交代了發文規範。

四段的判定結果如下,看最右邊兩欄。

流程 模型 六條規定:對/錯/未提 捏造的規定數
F1 只給題目 Haiku 4.5 2/1/3 1
F1 只給題目 gpt-6-astra 6/0/0 0
F2 給簡章原文 Haiku 4.5 6/0/0 0
F2 給簡章原文 gpt-6-astra 6/0/0 0

Haiku 只拿到題目時,把字數門檻寫成「一般為 200 字以上」。數字很具體,卻與簡章不符。它還多寫了四種說法:不能是純商業廣告或連結農場、建議用標籤和分類、建議用 Markdown,以及準時發文是「獲得評審青睞的關鍵」。整本簡章都找不到這些說法;評審要點列的是主題、結構、內容、表達,沒有準時這一項。

不過,這四種說法要分開看。「不能是純商業廣告或連結農場」寫成了規定,計為捏造 1 條;「獲得評審青睞」是沒有依據的評審主張,另外記錄;標籤與 Markdown 則只是建議。簡章沒提到的建議,不能因此算成捏造規定。第一版把四種全算進去,算得太寬。上表已改成 1 條,原始計數 4 留在實驗紀錄裡。

gpt-6-astra 只拿到題目時,先說無法核實 2026 年的規範,改引 2025 年簡章。結果六項都寫對了,連 F2 漏給的當日修改與賽後刪文也寫對了。

這也讓我想到,只給題目時,模型可能自行查詢資料,不一定會憑空補答案。這次成品附了連結,但光是附連結,還不足以證明它實際查過。能確定的是,它明白說引的是 2025 年簡章,附的也是去年的連結。內容與今年相符,仍不等於核實了今年的版本。

給了原文之後,兩個模型都是六項全對,沒有捏造規定。

四段同樣叫「AI 生成」,表現卻不同:一段寫錯字數門檻,還多出簡章沒有的說法;一段查核項目全對,但引用的是去年版本;另外兩段依提供的原文作答。對準備參賽的新手來說,這些差別直接影響能不能照著做,標籤卻一項也沒交代。

從成品看得出流程嗎

我另外把四段去掉模型名與流程名、打亂編號,交給 gpt-5.6-sol 判斷。它知道兩種流程的定義,也知道各有兩段,但沒有拿到簡章原文。結果四段全判對了。

這表示,在選項和數量都已知的情況下,這四段成品留下了足以分類的線索。還不能據此說,讀者能還原文章的完整製作流程。原訂六段、兩個判官的檢驗也尚未完成,這次只做了四段、由一個模型判斷。

即使猜對流程,線索也是從文章內容讀出來的,「AI 生成」四個字仍然沒有交代那些資訊。因此,這項觀察留作後續問題,不拿來支持或反駁第 2 律。對作者來說,直接寫清楚用了什麼,比留給讀者猜更實在。

這次結果讓我改了哪些想法

「給資料就少捏造」,得說得更精確。

Haiku 的捏造數從 1 降到 0,六個查核項目也從 2 項答對變成全部答對。至少在這一題、這一次輸出裡,提供原文的流程表現更好。astra 則是 0 對 0,給資料前後都沒有捏造規定。提供資料的作用,可能不只在減少錯誤,也在讓作答有一份明確的依據。

我事前訂的否證條件是「不給資料的捏造數不高於給資料的」,astra 確實符合。照這個判準,原本的預期沒有過關,不能看到結果後才把平手排除。但 0 對 0 也沒有證明資料無用:原本就沒有捏造,這個指標自然量不到進步。該修正的是「給資料一定會少捏造」的預期,以及只看捏造數的判法。

另一件事是,我沒給資料,不等於模型不知道答案。astra 自稱引用 2025 年簡章,卻答對今年的六個查核項目。規定可能跨年度重疊,模型也可能早已見過相關內容。我還沒核對去年的簡章,無法確定。第 1 律回頭打到了今晚的實驗:比較之前,仍得先查材料。

準備資料與評分的過程也都出了錯。F2 少拿了兩條原文;Claude 初判又曾把簡章裡有的「賽後刪文影響資格」誤算成捏造,後來才更正,而我沒有逐格核對。把原文交給模型之後,還得檢查資料給齊了沒有、評分判對了沒有。

這次只有一題、四次輸出,還分不出結果來自模型的穩定差異、單次波動,還是呼叫介面不同的影響。原訂「人先列論點、模型再擴寫」的流程也沒跑,所以這篇還談不到「AI 協助」的實測結果。

下一次標示 AI 使用時,多寫一行

我最在意的,還是 Haiku 寫出的「200 字以上」。讀者如果不知道正確門檻,很難光憑這句話發現問題。模型用了什麼資料、後來有沒有人核對,都會影響這段話值不值得信。

不用等到下一輪實驗,我現在就能多做一件事:在「AI 生成」或「AI 協助」後,寫清楚用了哪個模型、提供了什麼資料,以及人核對到哪一步。不必貼出整段對話,先把這些交代清楚。

照這個標準,本文的協作紀錄是:Claude 依我整理的寫作規則起草,資料包括簡章第 3 頁該節原文、今晚四段成品與判定表;gpt-6-astra 潤稿一次;六個 AI 審查者對前一版檢查了兩輪,我依發現修正;Codex 再整理一次段落與判定的說法,Claude 最後順稿。我逐句核對過用語與引文,判定表沒有逐格核對;最終版沒有再經那六個審查者審查。

下一篇談會看圖、會描述圖、會生圖,為什麼是三件事。


上一篇
第 1 律:比較模型之前,先確認題目沒有出現在訓練資料裡
下一篇
第 3 律:會看圖、會描述圖,和會生圖是三件事
系列文
生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則29
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言