Day 20 那篇草稿,我自己念出聲讀了一次。讀到第三段卡住了——不是內容不對,是語氣不對。「值得注意的是」開頭、「此外」接一句、「總的來說」收尾,三段裡出現了三次一模一樣的句型骨架。內容是我提供的材料生成的,沒有錯,但讀起來不像我會寫的句子,像是套了一個模板。
這篇要處理的不是「這樣寫錯不錯」,是「這樣寫像不像我」。論文最終要掛我的名字,語氣也是內容的一部分。
AI 腔調不是玄學,它有具體的樣子
先講清楚在抓什麼,不然「去 AI 腔」這件事會變成憑感覺瞎改。我自己整理出來,最常見的幾種:
過渡詞堆砌。 「值得注意的是」「此外」「然而」「總的來說」,密度遠高於一般人寫作的習慣。人寫東西,段落之間的連接常常是隱含的,不需要每一句都掛一個路標。
每段都是三點排比。 生成的文字很喜歡把任何論點拆成三項並列,即使那個主題本來就不是三件事。三點式本身沒有錯,錯的是每一段都用同一個結構,讀起來像同一份模板複製貼上。
語氣比證據更肯定。 這是 Day 8 提過的問題在論文本文裡的另一種樣子——原文材料裡是「可能相關」,生成出來變成「顯示出相關性」;材料裡是「初步發現」,生成出來變成「研究證實」。確定程度被悄悄調高了。
句子長度過於均勻。 人寫作的句子長短是波動的,短句接長句接短句。生成的文字常常每句都差不多長,讀起來像節拍器,沒有呼吸感。
形容詞堆砌但不具體。 「顯著的」「重要的」「深遠的」這種詞出現的頻率很高,卻常常沒有對應到具體的數字或例子去支撐它。
這些不是「AI 寫的東西都很爛」的意思,是這些修辭模式在大量生成文字裡出現的頻率,遠高於人類寫作的自然分布。抓的不是對錯,是分布異常。
為什麼要在意,不只是美感問題
三個理由,重要程度依序遞減,但每個都是真的。
第一,語氣的確定程度要跟證據的確定程度一致,這是學術誠信的核心,不是文字修飾。把「可能相關」寫成「顯示相關性」,是在替我還沒做的論證背書。這件事我不能交給工具判斷,因為工具不知道我的證據撐不撐得住那個語氣。
第二,這是我在 Day 1 就畫的紅線——不讓 AI 寫論文內容。生成一段草稿去理解材料怎麼組織,跟直接把那段草稿當成論文交出去,中間隔著「我有沒有把它變成我自己的話」這一步。這一步不做,那條紅線名存實亡。
第三,比較現實的一層:越來越多學校用 AI 偵測工具掃論文,這些工具抓的正是上面那些修辭模式的統計分布。就算我百分之百自己構思、只是借用 AI 生成初稿再改寫,如果改寫不夠徹底,還是可能被標記,然後要花更多力氣去解釋這件事,而解釋的過程比直接寫成人話麻煩得多。
AI 腔調從哪裡來
理解成因,才知道怎麼改。這些修辭模式不是隨機出現的,是訓練資料裡大量說明文、摘要、報告類文字的共同傾向被放大了——過渡詞讓生成的內容看起來「有條理」;三點排比讓內容看起來「全面」;肯定語氣讓內容看起來「有把握」。這些都是為了讓生成結果讀起來像一篇完整的文章,而不是為了準確反映材料裡的不確定性。
知道這件事之後,我對待生成草稿的態度改變了:草稿是拿來看「材料怎麼組織」的骨架,語氣本身要整段重寫,不是挑幾個詞換掉。
規則檔:一份 AI 痕跡清單
analysis/ai-tone-checklist.md:
值得注意的是、此外、然而、總的來說、需要指出的是、
不僅如此、綜上所述、值得一提的是
可能/或許 → 顯示、證實、表明
初步發現 → 研究證實
有關聯 → 有顯著相關(未附統計量時尤其危險)
部分支持 → 支持
「值得注意的是」用在真正需要提醒讀者「這裡容易誤讀」的地方,不算痕跡
三點排比用在真的是三件事的地方,不算痕跡
「不算痕跡」這一段跟「哪裡會出錯」直接相關,先寫在這裡提醒自己:這份清單是抓分布異常,不是抓某個詞本身有罪。
SKILL.md 全文
存在 .claude/skills/ai-tone-check/SKILL.md:
使用者指定要檢查的段落或章節
analysis/tone-report.md,逐點列出:位置、類型、原文(若涉及材料)、生成稿、建議方向(不是建議句子)
一段示範,跟報告長什麼樣
生成稿的一段(虛構材料):
值得注意的是,夜班護理人員的睡眠品質可能與職業倦怠有關。此外,工時過長也顯示出對心理健康的負面影響。總的來說,這些因素共同構成了夜班護理人員面臨的重大挑戰。
報告會抓出這些:
夜班護理人員的睡眠品質與職業倦怠呈正相關(r = .42),工時過長也與倦怠分數升高有關聯。這兩個變項彼此也可能互相影響,本研究的橫斷式設計無法區分何者為因、何者為果。
改寫拿掉了三個過渡詞、把「顯示負面影響」換回材料裡實際的統計量、拿掉「重大挑戰」這種沒有支撐的形容詞,多加了一句橫斷式設計的限制——這句是報告沒有提示我的,是我自己想到材料裡的限制欄該被用在這裡。
哪裡會出錯
它會把「檢查」誤解成「順便改好」。 第一次沒把規則一寫清楚,它掃完報告之後,主動把整段重寫貼在後面,說「已幫您優化」。我沒有要它優化。跟 Day 10 查證、Day 14 資料清理的離群值是同一個問題——工具的角色是報告,語氣要多保守、多肯定,是我對證據強度的判斷,不是工具能替我做的決定。
不是每個過渡詞出現都算痕跡。 第一版清單只要出現「值得注意的是」就標記,結果我自己寫的一句真心覺得需要提醒讀者的地方也被標了。規則檔加上「不算痕跡」那段之後,才開始看語境——是真的在提醒讀者容易誤讀的地方,還是純粹當轉折的填充詞。
過度清除排比句,論文會失去該有的結構。 三點並列本身是清楚的寫作工具,我一度矯枉過正,看到排比就想拆掉,結果一段原本清楚的論點被拆得七零八落,讀起來反而更亂。後來調整成只抓「連續三段以上用同一種排比結構」,單一段落裡的排比不算問題。
它抓不到我自己寫出來的相似語氣。 這份清單是拿生成草稿的統計特徵去比對,如果我自己寫作時剛好也習慣用「此外」開頭,它一樣會標記,因為它看的是文字表面的模式,不知道這句話是誰寫的。這種時候標記出來也沒關係,多一次檢查不吃虧,但不代表被標記的都是生成的痕跡,也可能只是我自己的習慣需要改,這件事工具幫我看見了,但判斷還是我做。
這件事跟資料週的線是同一條
Day 14 到 17 的判準是「規則明確、結果可驗證、動作可逆,才讓它動手」。語氣這件事,規則能寫清楚(過渡詞密度、排比重複),但「這句話的確定程度該多高」不可驗證——沒有標準答案,只有跟證據強度是否相符。所以今天的工具停在報告,跟 Day 10 查證是同一個決定:規則越模糊、判斷成分越高,工具的角色就該退得越後面。
我還不確定的地方
這份清單多久要更新一次,我沒有答案。生成模型的寫作習慣本身在變,今天列的這幾種模式,可能半年後就不是最常見的了,清單需要跟著更新,但更新的依據是什麼、多久檢查一次,我還沒想清楚。另外要不要額外用外部的 AI 偵測工具再掃一次論文,我還在猶豫——這類工具準確率有爭議,用它來確認自己有沒有漏改,跟依賴它來證明論文「夠人」,是兩件不一樣的事,我不想把判斷權讓給一個我不確定準不準的工具。
明天
Day 22:口試模擬器。讓 AI 扮演口試委員,針對我的論文提問——這個工具的風險比今天更高,因為它不只是檢查語氣,是要預演一場真實會發生的對話。