昨天我們在 Dify 知識庫中成功建立了第一筆資料,並將 FHIR 講義投影片上傳解析。然而,在昨天的解析成果中,系統自動將講義切成近400個片段(Chunks),其中有些只有短短十幾個字。
如果文字切得太碎,AI 在回答時就會「只看字面、失去上下文前後文脈絡」;反之,如果一段切得太長,又會把過多不相干的雜訊塞進模型中。今天我們就來深入探討 RAG 流程中最關鍵的工序——文件切分(Chunking),並透過「自訂分段」找出最適合醫資講義的設定參數!
大型語言模型(LLM)每次能處理的資訊窗口有限,且檢索系統是透過比對「語意相似度」來抓取關聯內容。
| 比較維度 | 自動分段(Automatic) | 自訂分段(Custom) |
|---|---|---|
| 運作機制 | 當系統達到預設位元組數或字元數自動切割 | 使用者自訂分段識別符號與分段最大長度 |
| 清洗選項 | 無法手動調整 | 可手動勾選移除多餘空格、空行、特殊符號 |
| 重疊字數 | 預設固定值 | 可自訂重疊字數,避免專有名詞被攔腰斬斷 |
| 適用對象 | 一般連續長文 | 課堂簡報、條列式教材 |
進入知識庫檔案重新分段介面
核心參數設定技巧
點開後會跳出分段設定面板,我們針對關鍵參數進行調校:
為什麼選800?投影片通常是一頁一個主題,800字元剛好能完整收納1~2頁投影片的核心重點,既不會太長失去檢索焦點,也不會過於破碎。
關鍵作用:重疊區能讓相鄰的兩個區塊共享前後50個字,避免專有名詞或專業英文縮寫剛好在段落交界處被攔腰截斷!
預覽與重新處理
在面板中點擊藍色的「預覽資料塊(Preview Chunk)」,確認預覽出來的切片不再是單獨一個字或一句話,而是包含完整說明的文字段落。往下滑動點擊「保存並處理」,系統便會根據新規則重新對講義進行切塊與索引。
經過這次切分優化後,成果對比非常顯著: