RAG 真正困難的不是把文件放進向量資料庫,而是如何證明系統真的變好。本系列從 Query 設計、人工標註與 Qrels 建立開始,逐步比較 BM25、Dense Retrieval、Embedding 微調、Hybrid Search 與 Rerank,最後串接 RAG 並評估回答品質。透過 Hit@K、MRR、NDCG、Macro-F1、Faithfulness 等指標與 Ablation Study,建立一套可重現的企業知識檢索工程流程。
前一篇討論「BM25 為什麼可能打贏 Vector:第一輪 Error Analysis」,這篇聚焦「Chunking 不是越碎越好:文件單位如何改變檢索」,並...
前一篇處理「Chunking 不是越碎越好:文件單位如何改變檢索」,這篇進一步討論「Query Normalization 與 Metadata Filteri...
完成「Query Normalization 與 Metadata Filtering:便宜但常被忽略的提升」後,下一個問題是「Hard Negative:Fi...
延續「Hard Negative:Fine-tune 前最重要的資料工程」,這篇聚焦「Embedding Fine-tuning Dataset:怎麼切才不會資...
前一篇討論「Embedding Fine-tuning Dataset:怎麼切才不會資料洩漏」,這篇聚焦「Fine-tune multilingual-e5:從...
前一篇處理「Fine-tune multilingual-e5:從 Base Model 到 Domain Retriever」,這篇進一步討論「Fine-tu...
完成「Fine-tune 之後真的變好嗎:別只看一個平均分數」後,下一個問題是「Hybrid Retrieval:BM25 + Vector 要怎麼融合」能否重...
延續「Hybrid Retrieval:BM25 + Vector 要怎麼融合」,這篇聚焦「Graph/Domain Signal 要不要加:第三種檢索訊號的價...
前一篇討論「Graph/Domain Signal 要不要加:第三種檢索訊號的價值」,這篇聚焦「Reranker 為什麼常比「換更大 Embedding」更划算...
前一篇處理「Reranker 為什麼常比「換更大 Embedding」更划算」,這篇進一步討論「把 Reranker 接進 Pipeline:Top-50 到...