iT邦幫忙

2026 iThome 鐵人賽

DAY 8
0
AI 自動化

大學生的生存筆記:用 Dify 零程式打造專屬課堂複習與考前衝刺 Agent系列 第 8 篇

Day 8:文件切分(Chunking)設定:如何切段 AI 才讀得懂?

  • 分享至 

  • xImage
  •  

一、前言

昨天我們在 Dify 知識庫中成功建立了第一筆資料,並將 FHIR 講義投影片上傳解析。然而,在昨天的解析成果中,系統自動將講義切成近400個片段(Chunks),其中有些只有短短十幾個字。
如果文字切得太碎,AI 在回答時就會「只看字面、失去上下文前後文脈絡」;反之,如果一段切得太長,又會把過多不相干的雜訊塞進模型中。今天我們就來深入探討 RAG 流程中最關鍵的工序——文件切分(Chunking),並透過「自訂分段」找出最適合醫資講義的設定參數!

二、為什麼長篇講義需要切分(Chunking)?

大型語言模型(LLM)每次能處理的資訊窗口有限,且檢索系統是透過比對「語意相似度」來抓取關聯內容。

  • 不切分的缺點:整份幾十頁的投影片當成一大包,檢索系統抓不出哪一段才是核心考點,且容易超出 Prompt 的上下文限制。
  • 切太碎的缺點:例如將「HL7 FHIR 的四大特點」切成四個孤立的小塊,當你提問架構時,AI 可能只檢索到其中一點,漏掉其他重點。
  • 理想的切分目標:讓每一個段落(Chunk)都具備「一個完整的概念或機制」,既包含標題、定義,又保留具體的說明。

三、Dify 的分段模式對比:自動(Automatic)vs. 自訂(Custom)

比較維度 自動分段(Automatic) 自訂分段(Custom)
運作機制 當系統達到預設位元組數或字元數自動切割 使用者自訂分段識別符號與分段最大長度
清洗選項 無法手動調整 可手動勾選移除多餘空格、空行、特殊符號
重疊字數 預設固定值 可自訂重疊字數,避免專有名詞被攔腰斬斷
適用對象 一般連續長文 課堂簡報、條列式教材

四、實作:手動調整自訂分段(Custom)設定

  1. 進入知識庫檔案重新分段介面

    • 點選左側導覽列的 「知識庫(Knowledge)」,點進昨天建立的講義知識庫。
    • 點擊右上角的 「⋯」(更多選項)➔ 點選 「分段設定」。
  2. 核心參數設定技巧
    點開後會跳出分段設定面板,我們針對關鍵參數進行調校:

    1. 分段識別符號:將預設的換行符號 \n 改為 \n\n (段落分隔符號)
    2. 分段最大長度:將系統預設的1,024改為800

      為什麼選800?投影片通常是一頁一個主題,800字元剛好能完整收納1~2頁投影片的核心重點,既不會太長失去檢索焦點,也不會過於破碎。

    3. 分段重疊長度:維持50字元

      關鍵作用:重疊區能讓相鄰的兩個區塊共享前後50個字,避免專有名詞或專業英文縮寫剛好在段落交界處被攔腰截斷!

    4. 文字預處理規則:勾選「替換掉連續的空格、換行符和製表符」,過濾掉簡報轉檔時常見的多餘空白排版雜質。
  3. 預覽與重新處理
    在面板中點擊藍色的「預覽資料塊(Preview Chunk)」,確認預覽出來的切片不再是單獨一個字或一句話,而是包含完整說明的文字段落。往下滑動點擊「保存並處理」,系統便會根據新規則重新對講義進行切塊與索引。

五、改善成果驗收:388塊 ➔ 41塊!

經過這次切分優化後,成果對比非常顯著:

  • 優化前(預設單換行切分):切出高達388塊,平均只有44字元,內容破碎且無上下文。
  • 優化後(改為 \n\n + 800 字長度):整體切片數量大幅收斂至41塊!
  • 點開現在的41塊切片,每一塊都能清楚看到「主題名稱 + 完整條列定義 + 相關說明」,上下文一氣呵成,完全解決了資訊碎片化的痛點!

上一篇
Day 7:建立專屬知識庫:上傳第一份 PDF 講義
下一篇
Day 9:知識庫檢索測試(召回測試):驗證提問抓取準確度
系列文
大學生的生存筆記:用 Dify 零程式打造專屬課堂複習與考前衝刺 Agent 共 10 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言