前幾天的文章一直在講怎麼問 AI、怎麼把問題問清楚。
但就算問題問得很清楚,還是有一個很麻煩的問題: AI 會亂講話,亂給答案。
而且最可怕的不是它亂講。
是它亂講的時候,常常講得非常有自信。
這幾年我用 AI 最常做的事情之一,大概就是跟它吵架。
「這個資料哪裡來的?」
「你是不是亂寫?」
「這篇論文真的存在嗎?」
然後 AI 很常會回我:
「您說得對,我剛才的回答有誤。」
看到這句真的會很想翻白眼。
這就是大家常說的 AI 幻覺(Hallucination)。
簡單講,就是 AI 產生了一個看起來很合理、語句也很完整,但實際上可能根本不是真的答案。
它可能弄錯年份、人物、公司、地點,也可能把兩件真的事情拼成一件假的事情。
最經典的是論文。
以前我還真的叫 AI 幫我找過文獻,看起來作者、題目、期刊全部都有模有樣,結果一查:
根本沒有這篇。
我博士班有一個同學很常講一句話:
「NotebookLM 比較不會有 AI 幻覺。」
這句話我其實懂她的意思。
因為 NotebookLM 比較強調根據你提供的資料來源去回答,所以理論上確實比較不容易完全憑空亂跑。
但我們班上其實大家多少都會用 AI。
問題不是「會不會用」。
而是:
大家都踩過雷。
最常見的就是文獻。
AI 很會幫你整理文獻。
也很會幫你「生」文獻。
尤其有些 AI 風格的投影片,一排看下去:
作者有了。
年份有了。
題目有了。
期刊名稱也有了。
看起來超完整。
然後真的去查:
欸?這篇去哪裡了?
有時候才發現,那根本是一篇「AI 生成的文獻」。
所以我現在看到 AI 幫我列文獻,第一個反應已經不是:
「太好了,資料找到了。」
而是:
「等一下,這篇真的存在嗎?」
這也讓我開始覺得:
「NotebookLM 比較不會幻覺」這句話,其實還要再往下問。
比較不會,是因為什麼?
是因為它被限制在指定來源裡?
還是因為它會顯示引用?
如果原始資料本身有錯呢?
如果它引用的是對的,但理解錯了呢?
如果它把兩段資料接在一起,變成另一個意思呢?
所以真正重要的,好像不是記住:
「哪一個 AI 比較不會幻覺。」
而是搞清楚:
它根據什麼回答?回答能不能被驗證?
這種事情如果只是聊天還好。
但如果拿來寫報告、研究、工作文件,就很危險。
所以我最近開始改變用 AI 的方式。
我不再只問:
「答案是什麼?」
而是會多問幾件事情:
但後來我才發現,光靠「提醒 AI 不要亂講」其實也不夠。
因為現在工程上處理 AI 幻覺,通常不是靠一句 Prompt 解決,而是加很多層機制。
例如最常聽到的 RAG。
先去資料庫、文件或指定來源找資料,再要求 AI 根據找到的內容回答。
再來是 Fact Check。
回答完之後,再檢查這些內容到底有沒有被原始資料支持。
還有 Guardrail。
如果資料不足、找不到證據,乾脆不要回答,或直接標示不確定。
甚至可以再找另一個 AI 來檢查前一個 AI。
看到這裡我突然覺得很好笑。
我們以前以為 AI 很厲害,所以要相信它。
結果真的開始用之後,反而花很多力氣在設計:
怎麼不要太相信它。
所以我現在覺得,用 AI 有一個很重要的習慣:
不要因為它講得像真的,就把它當真的。
AI 很會整理、很會生成,也很會把一句話講得非常完整。
但最後要不要相信,還是要看:
它有沒有證據。
明天就來繼續看看,現在工程師到底用哪些方法,想辦法降低 AI 幻覺。