RAG 真正困難的不是把文件放進向量資料庫,而是如何證明系統真的變好。本系列從 Query 設計、人工標註與 Qrels 建立開始,逐步比較 BM25、Dense Retrieval、Embedding 微調、Hybrid Search 與 Rerank,最後串接 RAG 並評估回答品質。透過 Hit@K、MRR、NDCG、Macro-F1、Faithfulness 等指標與 Ablation Study,建立一套可重現的企業知識檢索工程流程。
做出一個 RAG Demo,其實已經不算困難。 準備文件、切 chunk、做 embedding、丟進 vector database,再把 Top-K con...
「我的 RAG 看起來答得不錯。」 這句話最大的問題不是「不錯」太主觀,而是我們根本不知道它在做哪一種任務。 使用者輸入「VPN 登入失敗怎麼處理」,系統可能需...