模型是別人訓練的,你動不了。但從模型到能穩定運作的 AI 系統之間,有四層你能動的工程槓桿。這 30 天沿抽象層次往上走:Prompt Engineering,從 Transformer 機制理解 prompt 為何有效、極限在哪;Context Engineering,以 RAG、記憶與 Compaction 決定窗口放什麼;Harness Engineering,用 Session、Tool、Permission、Skills 打造模型外的執行系統;Loop Engineering,靠評估與可觀測性讓系統持續變好。
同一個模型的 API,有人做出的 Agent 穩定得像個資深同事,有人做出的連 demo 都撐不完。模型人人都叫得到,效果卻天差地遠。 差距不在模型。模型是別人...
昨天給了四層地圖,今天從最底層 L1 Prompt Engineering 開始。不從技巧開始講,先講機制,因為知道機制之後,大部分技巧你自己就推得出來。 我有...
昨天講注意力怎麼分配,今天講錢怎麼算。這兩件事共用同一個底層:token。你在 API 帳單上看到的每一個數字,背後都有機制可以解釋,知道機制之後,很多省錢手段...
昨天最後留了一個問題:歷史 token 的 K、V 算一次就不變,那共用開頭的請求,能不能共用計算?今天把這件事講完,因為 cache 是 L1 裡投資報酬率最...
前幾天都在講輸入端:注意力、成本、快取。今天換到輸出端。模型吐出來的是自然語言,是給人讀的;但系統裡下一站往往是程式:要進資料庫、要走 if/else、要呼叫下...
手調 prompt 的迴圈大家都跑過:改幾個字,跑一次,憑感覺判斷有沒有變好,再改幾個字。這個迴圈有兩個問題:「憑感覺」不可靠,「改幾個字」沒有方向。昨天說過,...
Prompt Engineering(這系列的 L1)講了六天,工具全部在桌上了:注意力機制、token 成本、兩層快取、結構化輸出、自動優化。今天要回答的是:...
昨天的三類故障(知識不在窗口、窗口被塞滿、窗口之間沒有連續性)都指向同一個決策:每一次呼叫,誰來決定模型看到什麼?從今天開始的第二層就在回答這件事。Andre...
昨天列了 Context Engineering(這系列的 L2)的工作清單,第一項是「模型缺的知識怎麼找進來」,這就是 RAG(Retrieval-Augme...
昨天結尾留的問題:對話裡產生的資訊(使用者的偏好、任務的進度、踩過的坑)不在任何文件裡,沒人幫你 reindex。想像一個場景:使用者在對話中糾正了 agent...