將用 30 天從 NLP 與資訊檢索出發,逐步打造能搜尋資料、產生回答、引用來源並評估品質的 RAG 知識助理。面對 LLM 可能產生幻覺、混淆版本資訊,甚至在資料不足時自信作答,本系列不只示範工具串接,而是理解文件清理、中文斷詞、切分、關鍵字搜尋、Embedding、向量資料庫、混合搜尋與 LLM 生成的演進。文章會搭配實作與固定評測集,觀察不同搜尋方法在專有名詞、同義表達與繁體中文文件上的表現,並實作來源引用、拒答與評測。讀者將看見 RAG 如何把原始 Markdown 文件轉成可搜尋的知識,讓模型根據證據回答、標示來源,也知道何時承認資料不足。
前言 因為前一個系列「讓 LLM 說話有憑有據:打造 RAG 知識助理」不小心斷賽,改為這個系列重發 近幾年,大型語言模型(Large Language M...
上一篇文章談到,RAG 的價值不只是讓 LLM 產生一段看起來合理的文字,而是讓回答能夠回到指定的知識來源。既然這個系列最後要完成一個 RAG 知識助理,今天就...
上一篇文章,我們替這個系列畫出清楚的範圍:要打造的是一個以繁體中文 Markdown 技術文件為知識來源,能夠回答技術問題、引用相關內容,並在資料不足時拒答的...
上一篇文章,我們討論了 LLM 的知識來源、Token 與 Context,也確定 RAG 不是把整個知識庫塞進 Prompt,而是先找到與問題相關的內容,再交...
上一篇文章,我們替知識庫建立了基本規則:使用 Markdown 保存原始文件,用 YAML Front Matter 保存識別碼、標題、來源、主題與版本,並讓原...
上一篇文章,我們完成了知識庫的文件載入器:讀取 Markdown、解析 Front Matter、清理格式雜訊,最後產生帶有 Metadata 與來源路徑的 D...
上一篇文章,我們把九份測試語料切成了 17 個 structured Chunk,也留下一個伏筆:「向量資料庫」被切成「向量/資料庫」還是「向量資料/庫」,會直...
上一篇文章,我們的關鍵字搜尋基準在四種問題上一好三壞,而且所有失敗都指向同一個原因:計分時每個詞都值一分,「是」和「401」完全等值。結尾留下了兩個直覺——一個...
上一篇文章,TF-IDF 把四題的 Top-1 命中從 2/4 拉到 4/4,但結尾記下了兩個沒解決的問題:TF 是線性的,「csrf」出現 7 次就拿 7 倍...
過去三天,關鍵字搜尋從詞集合比對演進到 TF-IDF 再到 BM25,每一步都拿同樣四個問題檢驗。但這個做法撐不了多久:四題是作者順手挑的,數量太少;更麻煩的是...