iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

誰偷走了我的 Tokens/s?LLM Inference 速度追兇記 系列

大型語言模型下載下來、載入 GPU,真的就算部署完成了嗎?「跑得動」只是第一步。本系列會從 Token 生成開始,拆解 Prefill、Decode、KV Cache、GPU 與記憶體瓶頸,介紹 Continuous Batching、PagedAttention、Quantization、Speculative Decoding 等推論技術,再實際研究 Transformers、llama.cpp、vLLM、SGLang、TensorRT-LLM、LMDeploy 等主流推論引擎,看看它們如何加速 LLM、各自適合什麼場景。這 30 天,就讓我們來找出誰偷走了 Tokens/s !

參賽天數 5 天 | 共 5 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1|同一張 GPU,為什麼別人就是比較快?

近幾個月,多家開源模型不斷冒出來,能力甚至直逼閉源模型! GLM、Kimi、MiniMax、Qwen……一個接一個冒出來,不只模型能力越來越強,也讓越來越多人開...

2026-09-14 ‧ 由 eden123 分享
DAY 2

# Day 2|你看到的是一句話,LLM 看到的卻不是

上一篇我們提到,如果想抓出到底是誰偷走了 Tokens/s,就得先知道 LLM 到底在忙什麼。 所以今天先從最基本的問題開始: LLM 到底是怎麼把一句話生出來...

2026-09-15 ‧ 由 eden123 分享
DAY 3

# Day 3|同樣都在跑 LLM,Prefill 跟 Decode 到底差在哪?

上一篇我們知道,LLM 並不是一次把整句答案吐出來。 它會不斷做同一件事: 看目前的內容 → 猜下一個 Token → 再繼續猜 但這裡其實少講了一件很重要的事...

2026-09-16 ‧ 由 eden123 分享
DAY 4

# Day 4|GPU 明明很快,為什麼 Token 還是吐這麼慢?

上一篇我們把 LLM Inference 拆成了兩個階段: Prompt → Prefill → Decode → Token → Decode → Token...

2026-09-17 ‧ 由 eden123 分享
DAY 5

# Day 5|只是多聊幾句,為什麼顯存越吃越多?

上一篇我們抓到第一個嫌疑犯: Memory Bandwidth 但 LLM Inference 還有另一個很常見的問題。 有時候模型明明跑得好好的,聊著聊著,顯...

2026-09-18 ‧ 由 eden123 分享