「地端 LLM 好慢」不是感覺,是一筆算得出來的帳。30 天用兩台真機實測——128GB 的 M4 Max 對上 2×RTX 4070 Ti——再用同一把尺推算到 RTX PRO 6000 與 H100,把「RAG 一問 45 秒」拆成量測、容量、吞吐、準確度四張地圖,修到 2 秒
內容:TTFT/TPOT 壓測、用 KV cache 與 roofline 算「能服務幾人」、thinking 與 prefix cache 調校、消費卡 GPU 共享、五顆 2026 開源模型解剖、RAG 七層歸因與 routing、LoRA 入門
上個月我在公司做了一件現在想起來還是會冒汗的事:跟主管 demo 地端 RAG。 機器是公司那台雙卡工作機,模型挑了一顆 32B 的新模型——反正兩張卡加起來...
昨天我們把那場 45 秒的 demo 慘案攤開,結論是 GPU 大部分時間在做你沒叫它做的事。今天先別急著修,因為修東西之前有個更基本的問題:你跟同事回報「地端...
Day 03 - 壓測不是 for 迴圈:vllm bench serve 的正確用法 大多數人的第一版壓測是一個 Python for 迴圈:串行打 100...
Day 04 - 讀懂模型名字:35B-A3B 到底是 35B 還是 3B 昨天我們把壓測的姿勢擺正了。但壓測有個更早的前提——你得先決定下載哪一顆模型。於是你...