將用 30 天從 NLP 與資訊檢索出發,逐步打造能搜尋資料、產生回答、引用來源並評估品質的 RAG 知識助理。面對 LLM 可能產生幻覺、混淆版本資訊,甚至在資料不足時自信作答,本系列不只示範工具串接,而是理解文件清理、中文斷詞、切分、關鍵字搜尋、Embedding、向量資料庫、混合搜尋與 LLM 生成的演進。文章會搭配實作與固定評測集,觀察不同搜尋方法在專有名詞、同義表達與繁體中文文件上的表現,並實作來源引用、拒答與評測。讀者將看見 RAG 如何把原始 Markdown 文件轉成可搜尋的知識,讓模型根據證據回答、標示來源,也知道何時承認資料不足。
前言 因為前一個系列「讓 LLM 說話有憑有據:打造 RAG 知識助理」不小心斷賽,改為這個系列重發 近幾年,大型語言模型(Large Language M...
上一篇文章談到,RAG 的價值不只是讓 LLM 產生一段看起來合理的文字,而是讓回答能夠回到指定的知識來源。既然這個系列最後要完成一個 RAG 知識助理,今天就...
上一篇文章,我們替這個系列畫出清楚的範圍:要打造的是一個以繁體中文 Markdown 技術文件為知識來源,能夠回答技術問題、引用相關內容,並在資料不足時拒答的...
上一篇文章,我們討論了 LLM 的知識來源、Token 與 Context,也確定 RAG 不是把整個知識庫塞進 Prompt,而是先找到與問題相關的內容,再交...