RAG 真正困難的不是把文件放進向量資料庫,而是如何證明系統真的變好。本系列從 Query 設計、人工標註與 Qrels 建立開始,逐步比較 BM25、Dense Retrieval、Embedding 微調、Hybrid Search 與 Rerank,最後串接 RAG 並評估回答品質。透過 Hit@K、MRR、NDCG、Macro-F1、Faithfulness 等指標與 Ablation Study,建立一套可重現的企業知識檢索工程流程。
做出一個 RAG Demo,其實已經不算困難。 準備文件、切 chunk、做 embedding、丟進 vector database,再把 Top-K con...
「我的 RAG 看起來答得不錯。」 這句話最大的問題不是「不錯」太主觀,而是我們根本不知道它在做哪一種任務。 使用者輸入「VPN 登入失敗怎麼處理」,系統可能需...
昨天我先把 retrieval task 寫清楚:7 份文件、7 筆 query、9 筆 relevance judgment,每一筆 query 都有至少一份...
昨天我把 corpus 的文件身份、metadata、重複與 snapshot hash 固定下來。但 corpus 乾淨,不代表評測就公平。 如果問題全是我看...
準備好 Query Set 之後,還不能立刻比較 BM25、Dense Retrieval 或 Reranker。評測前必須先知道每個 query 對應哪些相關...
Qrels 是 query 與 document 之間的相關性標註,也是 Retrieval 評測的答案基準。若標註規則不穩定,MRR、NDCG 或 Hit@K...
前一篇討論「兩個標註者不同意怎麼辦:一致性與裁決」,這篇聚焦「MRR、NDCG、Hit@K、Macro-F1@K 到底各在量什麼」,並沿用同一組輸入、環境與判讀...
前一篇處理「MRR、NDCG、Hit@K、Macro-F1@K 到底各在量什麼」,這篇進一步討論「BM25 Baseline:先尊重一個很難被淘汰的對手」。共同...
完成「BM25 Baseline:先尊重一個很難被淘汰的對手」後,下一個問題是「Dense Retrieval Baseline:Embedding 真的懂你的...
延續「Dense Retrieval Baseline:Embedding 真的懂你的 Domain 嗎」,這篇聚焦「BM25 為什麼可能打贏 Vector:第...