iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

不是模型太慢,是你沒算過這筆帳:地端 LLM 工程實戰 30 天 系列

「地端 LLM 好慢」不是感覺,是一筆算得出來的帳。30 天用兩台真機實測——128GB 的 M4 Max 對上 2×RTX 4070 Ti——再用同一把尺推算到 RTX PRO 6000 與 H100,把「RAG 一問 45 秒」拆成量測、容量、吞吐、準確度四張地圖,修到 2 秒
內容:TTFT/TPOT 壓測、用 KV cache 與 roofline 算「能服務幾人」、thinking 與 prefix cache 調校、消費卡 GPU 共享、五顆 2026 開源模型解剖、RAG 七層歸因與 routing、LoRA 入門

參賽天數 4 天 | 共 4 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 01 - 為什麼你的地端 RAG 一問就是 45 秒?

上個月我在公司做了一件現在想起來還是會冒汗的事:跟主管 demo 地端 RAG。 機器是公司那台雙卡工作機,模型挑了一顆 32B 的新模型——反正兩張卡加起來...

2026-08-12 ‧ 由 oblivionis 分享
DAY 2

Day 02 - TTFT、TPOT、ITL:別再說「好慢」,一次請求的時間帳

昨天我們把那場 45 秒的 demo 慘案攤開,結論是 GPU 大部分時間在做你沒叫它做的事。今天先別急著修,因為修東西之前有個更基本的問題:你跟同事回報「地端...

2026-08-13 ‧ 由 oblivionis 分享
DAY 3

Day 03 - 壓測不是 for 迴圈:vllm bench serve 的正確用法

Day 03 - 壓測不是 for 迴圈:vllm bench serve 的正確用法 大多數人的第一版壓測是一個 Python for 迴圈:串行打 100...

2026-08-14 ‧ 由 oblivionis 分享
DAY 4

# Day 04 - 讀懂模型名字:35B-A3B 到底是 35B 還是 3B

Day 04 - 讀懂模型名字:35B-A3B 到底是 35B 還是 3B 昨天我們把壓測的姿勢擺正了。但壓測有個更早的前提——你得先決定下載哪一顆模型。於是你...

2026-08-15 ‧ 由 oblivionis 分享