「地端 LLM 好慢」不是感覺,是一筆算得出來的帳。30 天用兩台真機實測——128GB 的 M4 Max 對上 2×RTX 4070 Ti——再用同一把尺推算到 RTX PRO 6000 與 H100,把「RAG 一問 45 秒」拆成量測、容量、吞吐、準確度四張地圖,修到 2 秒
內容:TTFT/TPOT 壓測、用 KV cache 與 roofline 算「能服務幾人」、thinking 與 prefix cache 調校、消費卡 GPU 共享、五顆 2026 開源模型解剖、RAG 七層歸因與 routing、LoRA 入門
上個月我在公司做了一件現在想起來還是會冒汗的事:跟主管 demo 地端 RAG。 機器是公司那台雙卡工作機,模型挑了一顆 32B 的新模型——反正兩張卡加起來...
昨天我們把那場 45 秒的 demo 慘案攤開,結論是 GPU 大部分時間在做你沒叫它做的事。今天先別急著修,因為修東西之前有個更基本的問題:你跟同事回報「地端...
Day 03 - 壓測不是 for 迴圈:vllm bench serve 的正確用法 大多數人的第一版壓測是一個 Python for 迴圈:串行打 100...
昨天我們把壓測的姿勢擺正了。但壓測有個更早的前提——你得先決定下載哪一顆模型。於是你打開 Hugging Face 逛了一圈,書籤列變成這樣: Qwen/Qwe...
昨天我們把模型名字拆成六個欄位,搞清楚了 35B-A3B 到底是 35B 還是 3B。檔名最後一段 Q4_K_M.gguf 我故意留到今天,因為它值得一整篇——...
昨天我們拆穿了 Q4_K_M 的真相——它是規格沒錯,但不是品質保證:同一個等級、不同人壓,第三方量到的 KL 散度可以差近三倍。 檔案會挑了,今天回答更前面的...
昨天結尾丟了一個問題沒答:DeepSeek-V4-Flash 的 3-bit 權重要 104GB,而 M4 Max 有 128GB,看起來剛剛好——真的剛剛好嗎...
昨天結尾說「萬事俱備」。W1 磨的尺、認的模型、摸清的記憶體線,今天全部上場:同一顆模型,MacBook 與 4070 Ti 誰快? 動手之前你八成會先 Goo...
昨天把 T1 對 T2 的第一場對照搭好,六根釘子釘完、兩排數字都開了,賽前那注也當場打臉,差額怎麼算留給 Day 10。昨天量的是「一個人問一句誰快」;今天照...
Day 10 - 546 對 504 帳面同級,為什麼 4070 Ti 實測快 41% Day 08 開賽前我押過一注。M4 Max 的記憶體頻寬帳面 546...