「地端 LLM 好慢」不是感覺,是一筆算得出來的帳。30 天用兩台真機實測——128GB 的 M4 Max 對上 2×RTX 4070 Ti——再用同一把尺推算到 RTX PRO 6000 與 H100,把「RAG 一問 45 秒」拆成量測、容量、吞吐、準確度四張地圖,修到 2 秒
內容:TTFT/TPOT 壓測、用 KV cache 與 roofline 算「能服務幾人」、thinking 與 prefix cache 調校、消費卡 GPU 共享、五顆 2026 開源模型解剖、RAG 七層歸因與 routing、LoRA 入門
動筆寫這個系列之前,我 Google 了「M4 Max 70B tokens per second」。搜尋第一頁的答案出奇一致:20-28 t/s。有表格、有結...
Day 01 我埋了一句話:「兩張卡的頻寬理論上可以疊加。疊不疊得起來?第 12 天見真章。」 今天見真章。答案比我當時想的麻煩:兩張卡各讀自己那半份權重時,5...
先看一組我自己量到的數字。gemma4:26b 跑在 M4 Max 上,Ollama 回報的 decode 速度是 90.2 tok/s,在地端算快。同一次請求...
昨天把三台機器擺在同一顆模型前面,量出來的是 tok/s。但提案會議上沒人問 tok/s,他們問的是另一句—— 「所以,這台機器能同時服務幾個人?」 這句話有三...
昨天那張速查表有一格很怪。 Gemma 4 只有 12B,一條 8K 對話卻要吃 448 MiB;gpt-oss-120b 有 117B,反而只要 293 Mi...
昨天把架構攤開:誰用 KDA 換掉 KV、誰用 sliding window 把快取壓成常數。那些是天生體質。今天動的是另一半——同一副體質,「回答前要不要先想...
Day 17 - Top-K 開到 30 才答得準,為什麼 M4 Max 多等 67 秒、4070 Ti 只多 8 秒? 最近最常收到的 RAG 現場描述是這句...
同一份手冊、同一個問題、同一行時間戳,我在 M4 Max 上只換了一件事:那行 當前時間:2026-08-28 19:41:07.842 放在 prompt 開...
同一份 100 頁 PDF、同一個問題,丟給地端模型要等一兩分鐘,送到雲端幾秒就開始回答。最常聽到的解釋是「雲端 GPU 比較快」。 這句沒錯,但太粗,粗到不...
先看一行 log。 speculative decode stats iterations=57 drafted=108 accepted=70...