iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

讓 LLM 不只會回答,還會查證:打造 Agentic RAG 智慧知識助理 系列

將用 30 天從 NLP 與資訊檢索出發,逐步打造能搜尋資料、產生回答、引用來源並評估品質的 RAG 知識助理。面對 LLM 可能產生幻覺、混淆版本資訊,甚至在資料不足時自信作答,本系列不只示範工具串接,而是理解文件清理、中文斷詞、切分、關鍵字搜尋、Embedding、向量資料庫、混合搜尋與 LLM 生成的演進。文章會搭配實作與固定評測集,觀察不同搜尋方法在專有名詞、同義表達與繁體中文文件上的表現,並實作來源引用、拒答與評測。讀者將看見 RAG 如何把原始 Markdown 文件轉成可搜尋的知識,讓模型根據證據回答、標示來源,也知道何時承認資料不足。

參賽天數 21 天 | 共 21 篇文章 | 4 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1|為什麼需要 RAG?從 LLM 幻覺到知識助理

前言 因為前一個系列「讓 LLM 說話有憑有據:打造 RAG 知識助理」不小心斷賽,改為這個系列重發 近幾年,大型語言模型(Large Language M...

2026-08-06 ‧ 由 Alan 分享
DAY 2

Day 2|先定義問題:我們要打造什麼樣的知識助理?

上一篇文章談到,RAG 的價值不只是讓 LLM 產生一段看起來合理的文字,而是讓回答能夠回到指定的知識來源。既然這個系列最後要完成一個 RAG 知識助理,今天就...

2026-08-07 ‧ 由 Alan 分享
DAY 3

Day 3|LLM 到底知道什麼?Token、Context 與知識限制

上一篇文章,我們替這個系列畫出清楚的範圍:要打造的是一個以繁體中文 Markdown 技術文件為知識來源,能夠回答技術問題、引用相關內容,並在資料不足時拒答的...

2026-08-08 ‧ 由 Alan 分享
DAY 4

Day 4|建立知識庫:從 Markdown 文件到可處理資料

上一篇文章,我們討論了 LLM 的知識來源、Token 與 Context,也確定 RAG 不是把整個知識庫塞進 Prompt,而是先找到與問題相關的內容,再交...

2026-08-09 ‧ 由 Alan 分享
DAY 5

Day 5|繁體中文文件清理:RAG 前不可忽略的 NLP 基礎

上一篇文章,我們替知識庫建立了基本規則:使用 Markdown 保存原始文件,用 YAML Front Matter 保存識別碼、標題、來源、主題與版本,並讓原...

2026-08-10 ‧ 由 Alan 分享
DAY 6

Day 6|Chunk 怎麼切才合理?文件切分策略比較

上一篇文章,我們完成了知識庫的文件載入器:讀取 Markdown、解析 Front Matter、清理格式雜訊,最後產生帶有 Metadata 與來源路徑的 D...

2026-08-11 ‧ 由 Alan 分享
DAY 7

Day 7|先不用 AI:中文斷詞與最基本的關鍵字搜尋

上一篇文章,我們把九份測試語料切成了 17 個 structured Chunk,也留下一個伏筆:「向量資料庫」被切成「向量/資料庫」還是「向量資料/庫」,會直...

2026-08-12 ‧ 由 Alan 分享
DAY 8

Day 8|TF-IDF:用統計方法找出重要文字

上一篇文章,我們的關鍵字搜尋基準在四種問題上一好三壞,而且所有失敗都指向同一個原因:計分時每個詞都值一分,「是」和「401」完全等值。結尾留下了兩個直覺——一個...

2026-08-13 ‧ 由 Alan 分享
DAY 9

Day 9|BM25:比 TF-IDF 更適合文件搜尋的方法

上一篇文章,TF-IDF 把四題的 Top-1 命中從 2/4 拉到 4/4,但結尾記下了兩個沒解決的問題:TF 是線性的,「csrf」出現 7 次就拿 7 倍...

2026-08-14 ‧ 由 Alan 分享
DAY 10

Day 10|建立第一個搜尋評測集:如何判斷搜尋結果好不好?

過去三天,關鍵字搜尋從詞集合比對演進到 TF-IDF 再到 BM25,每一步都拿同樣四個問題檢驗。但這個做法撐不了多久:四題是作者順手挑的,數量太少;更麻煩的是...

2026-08-15 ‧ 由 Alan 分享