本系列將從零打造一個以單一程式碼庫為範圍的唯讀 Codebase Intelligence Agent。先建立檔案與 symbol 索引,再結合 AST 結構化切分、關鍵字與語意檢索,以及 LLM 工具調用,讓使用者能以自然語言查詢架構、定位函式,並取得附檔案與行號的回答。後續加入 import 關係與 Git diff 分析,產出候選影響範圍、變更摘要與測試建議。最後完成可展示的 CLI 或簡易 Web 介面,並以實際程式碼庫案例驗收成果。
昨天(Day 10)我們把 AST 提取出的結構持久化到了 SQLite,並保留了同名 Symbol 的真實存在。 今天我們要利用 imports 資料表,回答...
到昨天為止,系統已經能精確查詢符號定義與模組引用關係。但這些查詢都有一個共同前提:使用者必須事先知道精準的名稱(例如 rag_common 或 COLLECTI...
昨天我們成功把 23 個語法 Chunks 轉換成 1024 維向量並存入 SQLite。 但如果你在程式碼庫裡只押注向量檢索,很快會踢到鐵板: 當使用者搜...
昨天我們利用 RRF 演算法成功將關鍵字(Lexical)與向量(Semantic)融合為 Hybrid Search。 但如果你直接把 Hybrid Sear...
在前兩週,我們依序完成了文字搜尋、AST 語法索引、直接 import 追蹤、向量嵌入以及基於 RRF 的 Hybrid Search。 但如果你問一個工程問題...
昨天我們把考題規格化,建立了機器可讀的評估資料集 data/eval_cases.json。 有了題目和標準答案後,下一個問題是:怎麼用程式量化「搜尋得好不好」...
在 Day 15 與 Day 16 中,我們準備好了題庫 data/eval_cases.json,也寫好了 Hit@k、MRR 與 Precision@k 的...