iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

企業知識檢索與 RAG 工程:標註、微調、混合檢索、Rerank 與可重現評測 系列

RAG 真正困難的不是把文件放進向量資料庫,而是如何證明系統真的變好。本系列從 Query 設計、人工標註與 Qrels 建立開始,逐步比較 BM25、Dense Retrieval、Embedding 微調、Hybrid Search 與 Rerank,最後串接 RAG 並評估回答品質。透過 Hit@K、MRR、NDCG、Macro-F1、Faithfulness 等指標與 Ablation Study,建立一套可重現的企業知識檢索工程流程。

參賽天數 25 天 | 共 25 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 11

Day 11|Chunking 不是越碎越好:文件單位如何改變檢索

前一篇討論「BM25 為什麼可能打贏 Vector:第一輪 Error Analysis」,這篇聚焦「Chunking 不是越碎越好:文件單位如何改變檢索」,並...

2026-09-25 ‧ 由 jackwu 分享
DAY 12

Day 12|Query Normalization 與 Metadata Filtering:便宜但常被忽略的提升

前一篇處理「Chunking 不是越碎越好:文件單位如何改變檢索」,這篇進一步討論「Query Normalization 與 Metadata Filteri...

2026-09-26 ‧ 由 jackwu 分享
DAY 13

Day 13|Hard Negative:Fine-tune 前最重要的資料工程

完成「Query Normalization 與 Metadata Filtering:便宜但常被忽略的提升」後,下一個問題是「Hard Negative:Fi...

2026-09-27 ‧ 由 jackwu 分享
DAY 14

Day 14|Embedding Fine-tuning Dataset:怎麼切才不會資料洩漏

延續「Hard Negative:Fine-tune 前最重要的資料工程」,這篇聚焦「Embedding Fine-tuning Dataset:怎麼切才不會資...

2026-09-28 ‧ 由 jackwu 分享
DAY 15

Day 15|Fine-tune multilingual-e5:從 Base Model 到 Domain Retriever

前一篇討論「Embedding Fine-tuning Dataset:怎麼切才不會資料洩漏」,這篇聚焦「Fine-tune multilingual-e5:從...

2026-09-29 ‧ 由 jackwu 分享
DAY 16

Day 16|Fine-tune 之後真的變好嗎:別只看一個平均分數

前一篇處理「Fine-tune multilingual-e5:從 Base Model 到 Domain Retriever」,這篇進一步討論「Fine-tu...

2026-09-30 ‧ 由 jackwu 分享
DAY 17

Day 17|Hybrid Retrieval:BM25 + Vector 要怎麼融合

完成「Fine-tune 之後真的變好嗎:別只看一個平均分數」後,下一個問題是「Hybrid Retrieval:BM25 + Vector 要怎麼融合」能否重...

2026-10-01 ‧ 由 jackwu 分享
DAY 18

Day 18|Graph/Domain Signal 要不要加:第三種檢索訊號的價值

延續「Hybrid Retrieval:BM25 + Vector 要怎麼融合」,這篇聚焦「Graph/Domain Signal 要不要加:第三種檢索訊號的價...

2026-10-02 ‧ 由 jackwu 分享
DAY 19

Day 19|Reranker 為什麼常比「換更大 Embedding」更划算

前一篇討論「Graph/Domain Signal 要不要加:第三種檢索訊號的價值」,這篇聚焦「Reranker 為什麼常比「換更大 Embedding」更划算...

2026-10-03 ‧ 由 jackwu 分享
DAY 20

Day 20|把 Reranker 接進 Pipeline:Top-50 到 Top-5 的重新排序

前一篇處理「Reranker 為什麼常比「換更大 Embedding」更划算」,這篇進一步討論「把 Reranker 接進 Pipeline:Top-50 到...

2026-10-04 ‧ 由 jackwu 分享