RAG 真正困難的不是把文件放進向量資料庫,而是如何證明系統真的變好。本系列從 Query 設計、人工標註與 Qrels 建立開始,逐步比較 BM25、Dense Retrieval、Embedding 微調、Hybrid Search 與 Rerank,最後串接 RAG 並評估回答品質。透過 Hit@K、MRR、NDCG、Macro-F1、Faithfulness 等指標與 Ablation Study,建立一套可重現的企業知識檢索工程流程。
完成「把 Reranker 接進 Pipeline:Top-50 到 Top-5 的重新排序」後,下一個問題是「品質換延遲值不值得:Rerank 的 Engin...
延續「品質換延遲值不值得:Rerank 的 Engineering Trade-off」,這篇聚焦「組出完整 Retrieval Pipeline:Fine-t...
前一篇討論「組出完整 Retrieval Pipeline:Fine-tune + Hybrid + Rerank」,這篇聚焦「最後才接 RAG:先做最小 Ge...
前一篇處理「最後才接 RAG:先做最小 Generation Baseline」,這篇進一步討論「Groundedness、Citation、Abstentio...
完成「Groundedness、Citation、Abstention:RAG 不只看答對沒」後,下一個問題是「Retrieval 變好,答案就一定變好嗎」能否...