iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

從零搞懂 RAG 評測之旅 系列

在這 30 天我們將從零開始,紮實拆解 RAG 的核心元件與運作流程,並深入剖析檢索與回答兩大面向共 8 種關鍵評測指標,建立清晰的診斷能力;透過循序漸進的觀念梳理與階段性總結,一步步建構出系統化的評測思維,擺脫盲目調整的困境,用客觀數據讓 RAG 系統發揮最大價值!

參賽天數 9 天 | 共 9 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day1. 前言

近年來,大型語言模型(Large Language Model, LLM)的能力快速提升,已能處理複雜的自然語言任務並生成流暢的回應。然而,此類模型的知識內容受...

2026-09-15 ‧ 由 gzt 分享
DAY 2

Day2. 介紹 RAG

RAG 的運作可拆解為檢索(Retrieval)與生成(Generation)兩個階段。使用者提出問題後,系統首先在外部知識庫中檢索與問題相關的內容,接著將檢索...

2026-09-16 ‧ 由 gzt 分享
DAY 3

Day3. 資料前處理與文件載入

原始文件在實務情境中,往往以高度異質的形式存在。企業內部知識庫可能同時包含 PDF 報告、Word 文件、網頁匯出的 HTML、簡報檔案,甚至是掃描後的紙本文件...

2026-09-17 ‧ 由 gzt 分享
DAY 4

Day4. Chunking 切分

前處理產出的乾淨文字,通常仍是以整份文件為單位存在,一份文件可能長達數千字,涵蓋多個主題與段落。若直接將整份文件作為檢索的最小單位,語意會過於龐雜而難以精確比對...

2026-09-18 ‧ 由 gzt 分享
DAY 5

Day5. Embedding / 向量化

Chunking 完成後,每個片段仍然是一段文字,而電腦本身並不理解文字的「意思」,它能處理的只有數字。Embedding(嵌入) 要解決的正是這個問題:將一段...

2026-09-19 ‧ 由 gzt 分享
DAY 6

Day6. 向量資料庫

Embedding 完成後,向量仍須妥善儲存,並在使用者提問時快速找出最相似的內容。若以逐筆比對的方式搜尋,運算量會隨資料量線性增加,難以應付大規模知識庫的即時...

2026-09-20 ‧ 由 gzt 分享
DAY 7

Day7. 索引階段回顧

文件從前處理、切分、向量化到存入向量資料庫,構成了 RAG 系統建立知識庫的完整流程。前處理將不同來源、格式的原始文件轉換為結構化的乾淨文字;切分依照特定策略,...

2026-09-21 ‧ 由 gzt 分享
DAY 8

Day8. Retriever 檢索機制

使用者提出問題後,這段文字同樣需要先經過向量化,透過與索引階段相同的 Embedding 模型轉換為向量,才能與向量資料庫中的內容進行比較。檢索(Retriev...

2026-09-22 ‧ 由 gzt 分享
DAY 9

DAY9. Re-ranking 重排序

在前幾天的文章中,我們已經一步一步建立了 RAG 的前半段流程: 文件 -> 前處理 -> Chunking -> Embedding -&...

2026-09-23 ‧ 由 gzt 分享