「地端 LLM 好慢」不是感覺,是一筆算得出來的帳。30 天用兩台真機實測——128GB 的 M4 Max 對上 2×RTX 4070 Ti——再用同一把尺推算到 RTX PRO 6000 與 H100,把「RAG 一問 45 秒」拆成量測、容量、吞吐、準確度四張地圖,修到 2 秒
內容:TTFT/TPOT 壓測、用 KV cache 與 roofline 算「能服務幾人」、thinking 與 prefix cache 調校、消費卡 GPU 共享、五顆 2026 開源模型解剖、RAG 七層歸因與 routing、LoRA 入門
三顆模型的 checkpoint tensor 加起來約 7.85 GiB。卡有 12 GiB,看起來很寬鬆。 再替三個 vLLM instance 各留一份...
昨天那張 12 GiB 預算表替 LLM、embedding、reranker 三張嘴分好了帳,第三張地圖收工。三週下來的帳很好看:Day 01 那個 45 秒...
昨天把一次答錯拆成七層。今天把手伸進第三層:向量本身。 我原本只想挑一顆 embedding。沒想到第一關,竟然不是分數,而是授權。 要的是能吃表格、圖表與掃...
昨天挑完 embedding:授權先看、max_seq_length 是硬上限、榜首不是你的榜首。今天換個更土的問題——到底要餵它多長的一段文字? 網路上的答案...
昨天處理的是一段文字怎麼切、切多大。假設那一關過了:片段都在庫裡、長度也合理。今天換個問題——搜尋卻拿錯了型號。 假設使用者問的是 PROD-SKU-7842...