昨天我們體驗了 Gemini 對整份數十頁報告的巨觀理解,今天我們要進行語言模型測試中最嚴苛的考驗——「大海撈針(Needle In A Haystack, NIAH)」測試。
這項測試旨在驗證:當模型面對數萬字無關的背景雜訊時,是否會因為注意力分散而產生「迷失在中間(Lost in the Middle)」的現象,進而忽略藏在文本深處的微小關鍵細節。
為什麼需要大海撈針測試?
在過去,許多宣稱支援長上下文的大型語言模型,往往只對文本「最前頭」與「最後尾」保持高度敏銳度,一旦關鍵線索被塞在幾十頁文件的中段,檢索召回率(Recall Rate)就會雪崩式下滑。
今天我們不靠人工插入虛構暗號,而是直接從昨天上傳的幾十頁真實企業永續報告書(ESG PDF)中,挑出一條極不起眼的審核與簽核權責流程條文作為我們的「針」,實測 Gemini 3 Flash 是否能在幾萬 Token 中精準鎖定並還原事實。
實測設計:尋找藏在深處的審核流程
大海(The Haystack):數十頁完整的企業永續報告書 PDF。
針(The Needle):藏在文件深處的真實審核規定——我找了以下這段「本報告書之內容由相關部門主管檢視,確保資訊的正確性。此外,永續發展委員會的各群組召集人亦對應相關章節進行審核,確保各項資訊的完整性與準確性。最終,本報告書提交至董事會,由董事會審查並核准通過。」
實測 Prompt 設計
在 Google AI Studio 中掛載該 PDF 附件,於輸入框下達以下考驗細節提取的指令:
請依據所附的永續報告書 PDF 內容,回答以下關於報告書編制與簽核流程的具體問題:
要求:
實作結果:

實測成果觀察與亮點
當點擊 Run 送出後,Gemini 3 Flash 展現了出色的長文本檢索表現:
今日結語
今天的大海撈針實測證明了一件事:Gemini 的百萬長上下文並非單純能「塞得下」大量文字,而是真正具備「全域檢索與精準穿透」的硬實力。
在實際的商業場景中,審閱合約中的隱藏責任條款、對照產品規格中的細節參數,往往就像在海量文字中找一根針。透過 Google AI Studio,平板用戶無需架設任何資料庫或切片檢索系統,就能直接擁有專業級的長文件穿透分析利器。