上一篇提到,Decode Attention 的主要成本之一,是反覆讀取前面 tokens 的 K 和 V。 為什麼不能每次都重新算? 因為產生第 t 個 to...
上一篇算過,Llama-3.2-1B 的 bf16 GQA KV Cache,每個 token 約需要 32 KiB。 如果只有一條固定長度的 sequence...
上一篇用 PagedAttention 解決了 KV Cache「怎麼放」的問題:切成 blocks、按需配置、用 block table 找到實體位置。 但每...
The everything Client │ POST /v1/chat/completions ▼ API Server Process │...
昨天 vLLM Engine Core 的主迴圈: schedule → execute → update 關鍵是這個迴圈只推進一個 engine step,...
Day 15 的 Continuous Batching 解決了「完成一條,就補進一條」。 但還有另一種卡頓:一條很長的新 prompt 進來,Prefill...
它快取的不是 Prompt 文字 假設兩條 requests 是: Request A = [system prompt][shared document][q...
它快取的不是 Prompt 文字 假設兩條 requests 是: Request A = [system prompt][shared document][q...
一條 request 上有四種時間 t0 送出 request │── transport + queue + Prefill + first decode ─...
昨天把 LLM serving 的速度拆成 TTFT 與 ITL。今天會發現,這兩個指標背後剛好是兩種不同的工作。 Prefill:一次處理整段 promp...