我有多年 IT 技術與跨域學習經驗,現在把 AI、Cloud、Infrastructure 串起來。
Day 25 我談到,當 AI Service 變慢時,應該先透過 Metrics、Logs 與 Traces 找出真正的 Bottleneck。
但找到效能問題後,很容易出現另一個直覺:
AI 很慢,那就多加幾張 GPU?
我自己在接觸 GPU、LLM 與 AI Infrastructure 的過程中,越來越發現事情沒有這麼簡單。AI Inference 是一整條處理鏈,GPU 只是其中一環。不要看到資源滿載就直接加資源;先確認 Bottleneck。找到 Bottleneck 之後,才有資格談 Optimization。
如果真正的 Bottleneck 是 Request Queue、Model Server、Batch 設定、Context Length、Model Loading、Storage I/O 或 Network,即使增加 GPU,也不一定能得到預期的改善。
Google Cloud 目前針對 GKE LLM Inference tooling 的最佳實務,它也不是單純要求增加 GPU,不是單純追求「GPU 越多越好」,而是分析 latency、throughput、cost 之間的 trade-off,尋找接近最佳 saturation point 的配置。而是依照不同目標選擇不同方法。例如降低 Latency、提高 Throughput 與降低 Cost,可能分別需要調整 GPU、Quantization、Batching、Tensor Parallelism、Context Length 或 Replica 數量。
Google Cloud 2026 年 8 月更新的 GKE LLM inference 最佳實務也採取類似思路:先 benchmark latency / throughput,再調整 inference server、quantization、parallelism、batching、context length 或 scaling,最後重新 benchmark 驗證,而不是看到效能問題就直接增加 GPU。
這讓我開始理解一個很重要的 Infrastructure 觀念:
Optimization 不是「增加資源」,而是找到限制系統效能的地方,再對症下藥。
甚至同一套模型與 GPU,也需要透過 Benchmark 比較調整前後的 Latency 與 Throughput,才能知道最佳化到底有沒有真的發生。Google Cloud 目前也建議採用 Benchmark → Tune → Benchmark 的循環驗證方式。我從 GPU、LLM 與 Infrastructure 的實作中,逐漸發現 GPU 並不是 AI Performance 的唯一變數。
現在 Google Cloud 的文件其實提供了一個很好的佐證:Inference Quickstart 會把 TTFT、NTPOT、Throughput、Queue Size、KV Cache 等資料一起 benchmark,找出 throughput 開始飽和、latency 開始惡化的區域,而不是簡單用「GPU utilization 越高越好」判斷效能。
所以問題來了:
當 AI Service 變慢時,我們是在真正解決 Bottleneck,還是只是用更多昂貴的 GPU 掩蓋問題?
這也是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》想討論的核心:Production Engineering 不只是把資源加上去,而是找到效能、成本與使用體驗之間合理的平衡點。正是因為GPU、RAM的需求缺口與價格高漲,我們更應該真正找出如果 AI 服務變慢,要怎麼找出真正問題?如何針對問題對症下藥?
關於作者
我是一名 AI × Infrastructure Solution / Integration 技術實作者,專注於 AI、MLOps、Cloud、Docker、Kubernetes、GPU、LLM 與 AI Agent 等技術的整合與落地,跨足 LLM、GPU、Docker、Kubernetes、MLOps 與 AI Agents,持續研究企業 AI 從 Prototype 到 Production 所需要的工程能力。協助企業理解 AI 從 Prototype 到 Production 所需要的技術能力。
本系列同時是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》的延伸實戰筆記。如果想完整理解這些更深的技術問題,未來可以去看這本書(書中包含了一些的範例與提示詞,特別是AMD W7900 48G的使用技術心得,這些是外面很少有的獨家踩坑經驗,未來買書真的賺到!)。敬請期待唷~