原始文件在實務情境中,往往以高度異質的形式存在。企業內部知識庫可能同時包含 PDF 報告、Word 文件、網頁匯出的 HTML、簡報檔案,甚至是掃描後的紙本文件影像;不同來源之間,格式、編碼、排版邏輯均不相同。在這些文件被送入後續的切分與向量化流程之前,必須先經過前處理,將其轉換為結構一致、內容乾淨的純文字。
前處理階段所要處理的問題,遠不只是「把文字取出來」而已。PDF 常見的多欄排版,若未妥善處理,擷取出的文字順序可能與原文閱讀順序不符;頁首頁尾、頁碼、浮水印等重複性內容,若未濾除,會在每個片段中反覆出現,稀釋真正有意義的資訊;表格與圖片中的資訊,若僅以純文字擷取,往往會遺失其原有的結構關係;掃描文件則需仰賴 OCR 技術辨識文字,而辨識錯誤本身即會成為後續檢索與生成的雜訊來源。
這個階段的品質,對整條 RAG pipeline 有著不成比例的影響。前處理產出的文字若夾雜大量雜訊或順序錯亂,即使後續採用再精良的切分策略與檢索演算法,也難以彌補源頭資料的缺陷,錯誤會沿著 pipeline 向下游傳遞,而非在中途被修正。因此,前處理雖然在整個流程中沒有 Embedding 或檢索機制那樣顯眼,卻往往是決定系統下限的關鍵環節。
除了將文件轉為乾淨文字之外,前處理階段通常也需要保留必要的中繼資訊(metadata),例如來源檔名、頁碼、章節標題等。這些資訊在後續生成回應時可作為引用依據,讓使用者得以追溯答案的來源,也是評測階段用來檢驗檢索正確性的重要依據。