大型語言模型下載下來、載入 GPU,真的就算部署完成了嗎?「跑得動」只是第一步。本系列會從 Token 生成開始,拆解 Prefill、Decode、KV Cache、GPU 與記憶體瓶頸,介紹 Continuous Batching、PagedAttention、Quantization、Speculative Decoding 等推論技術,再實際研究 Transformers、llama.cpp、vLLM、SGLang、TensorRT-LLM、LMDeploy 等主流推論引擎,看看它們如何加速 LLM、各自適合什麼場景。這 30 天,就讓我們來找出誰偷走了 Tokens/s !
近幾個月,多家開源模型不斷冒出來,能力甚至直逼閉源模型! GLM、Kimi、MiniMax、Qwen……一個接一個冒出來,不只模型能力越來越強,也讓越來越多人開...
上一篇我們提到,如果想抓出到底是誰偷走了 Tokens/s,就得先知道 LLM 到底在忙什麼。 所以今天先從最基本的問題開始: LLM 到底是怎麼把一句話生出來...
上一篇我們知道,LLM 並不是一次把整句答案吐出來。 它會不斷做同一件事: 看目前的內容 → 猜下一個 Token → 再繼續猜 但這裡其實少講了一件很重要的事...
上一篇我們把 LLM Inference 拆成了兩個階段: Prompt → Prefill → Decode → Token → Decode → Token...
上一篇我們抓到第一個嫌疑犯: Memory Bandwidth 但 LLM Inference 還有另一個很常見的問題。 有時候模型明明跑得好好的,聊著聊著,顯...