前幾天一直在講 AI 怎麼讀論文、怎麼處理 PDF。
結果我問了同事弟弟一個問題:
AI 到底是怎麼「讀」一整篇文章的?
他跟我說,其實不是我想像的那種,一個字一個字讀進去、理解完,再開始回答。
而是會先把文字切成 Token,再根據前面的內容,用條件機率去預測接下來最可能出現的 Token。
我聽完第一個反應是:
蛤?所以它不是在「讀」喔?
我原本真的以為:
台 → 灣 → 半 → 導 → 體
AI 就這樣一個字一個字讀。
但其實不是。
AI 會先把文字拆成 Token。
Token 可能是一個字、一個詞的一部分、一個標點符號,甚至數字也可能被拆開。
所以比較接近:
文字 → Token → 數字表示 → 看前後關係 → 預測下一個 Token
然後一直重複下去。
然後同事弟弟聽完我平常使用 AI 的方式,就開始念我:
「所以才叫你不要每次跟 AI 廢話那麼多,還在那邊聊天勒。」
好啦,我承認。
我真的很常跟 AI 聊天。
有時候明明只要問一件事情,我前面還會先講一大串背景,講到最後自己都忘記最早要問什麼。
以前我覺得這樣比較像在跟一個人溝通。
現在才開始理解:
多講不一定比較好。
如果那些內容跟任務沒有關係,一樣會進入上下文裡,AI 還是得處理。
所以問題不是「一定要講得很短」。
而是:
該給的背景要給,不相關的廢話可以少一點。
這件事情對我還滿難的(笑)。
例如我輸入:
台灣半導體產業的崛起與……
AI 不是先停下來想:
「好,我現在要完整理解台灣半導體產業史。」
它比較像是在算:
在前面這些 Token 已經出現的情況下,
下一個最合理出現的是什麼?
可能是:
然後從這些可能性裡產生下一段內容。
因為現在的大型語言模型不只是看前一個 Token。
它會透過 Attention 去看整個上下文裡,哪些資訊和目前這一段最有關係。
所以當你丟一篇論文進去,它可能會注意到:
然後根據這些關係產生回答。
這也解釋了為什麼,我前幾天一直覺得:
原始資料整理得越清楚,AI 通常越容易抓對重點。
如果一份 PDF 長這樣:
一大坨文字,沒有標題、沒有段落、數字全部混在一起。
AI 當然還是可以處理。
但如果資料本來就是:
章節標題 → 說明 → 表格 → 圖表 → 資料來源 → 結論
它就比較容易知道:
「這個數字是這個欄位的。」
「這段是在講研究方法。」
「這張表是在比較不同年份。」
所以我現在才開始理解:
不只是 Prompt 要整理好。
餵給 AI 的資料本身也要整理好。
因為 AI 的目標不是:
「我要保證下一句是真實世界的真相。」
而是比較接近:
「根據目前的上下文,下一個 Token 最合理是什麼?」
所以就可能出現一件很麻煩的事:
它講得超順,但其實是錯的。
也就是前幾天一直在講的 AI 幻覺。
這時我才真的理解,為什麼不能只跟 AI 說:
不要亂講。
因為「講出合理的下一句」,本來就是它很核心的工作方式。
所以還是要靠:
去降低出錯的機會。
以前我覺得:
AI 很會讀資料。
現在我會覺得更接近:
AI 很會處理 Token 之間的關係,然後根據上下文產生一個合理的回答。
聽起來好像只是換一句話。
但我覺得差很多。
因為知道這件事之後,我就比較不會把 AI 想成一個「什麼都懂的人」。
而比較像是一個:
非常會整理、連結、預測文字,但還是需要資料、規則和查證的工具。
所以我現在反而更知道:
為什麼問題要問清楚。
為什麼資料要整理好。
為什麼背景要給,但不要給一堆沒用的背景。
為什麼回答要查證。
原來前面十天講的那些東西,最後都繞回同一件事。
不是 AI 不夠聰明,而是我們要先知道它到底是怎麼工作的。
ps. Chatgpt,我對不起你 QQ