iT邦幫忙

2026 iThome 鐵人賽

DAY 26
0
Build on Google AI

AI Demo上 Production 之前:AI × Infrastructure 實戰筆記系列 第 26

Day 26 如果AI 變慢,多加 GPU 就一定有用嗎?

  • 分享至 

  • xImage
  •  

我有多年 IT 技術與跨域學習經驗,現在把 AI、Cloud、Infrastructure 串起來。

AI 變慢,多加 GPU 就一定有用嗎?

Day 25 我談到,當 AI Service 變慢時,應該先透過 Metrics、Logs 與 Traces 找出真正的 Bottleneck。

但找到效能問題後,很容易出現另一個直覺:

AI 很慢,那就多加幾張 GPU?

我自己在接觸 GPU、LLM 與 AI Infrastructure 的過程中,越來越發現事情沒有這麼簡單。AI Inference 是一整條處理鏈,GPU 只是其中一環。不要看到資源滿載就直接加資源;先確認 Bottleneck。找到 Bottleneck 之後,才有資格談 Optimization。

如果真正的 Bottleneck 是 Request Queue、Model Server、Batch 設定、Context Length、Model Loading、Storage I/O 或 Network,即使增加 GPU,也不一定能得到預期的改善。

Google Cloud 目前針對 GKE LLM Inference tooling 的最佳實務,它也不是單純要求增加 GPU,不是單純追求「GPU 越多越好」,而是分析 latency、throughput、cost 之間的 trade-off,尋找接近最佳 saturation point 的配置。而是依照不同目標選擇不同方法。例如降低 Latency、提高 Throughput 與降低 Cost,可能分別需要調整 GPU、Quantization、Batching、Tensor Parallelism、Context Length 或 Replica 數量。

Google Cloud 2026 年 8 月更新的 GKE LLM inference 最佳實務也採取類似思路:先 benchmark latency / throughput,再調整 inference server、quantization、parallelism、batching、context length 或 scaling,最後重新 benchmark 驗證,而不是看到效能問題就直接增加 GPU。

這讓我開始理解一個很重要的 Infrastructure 觀念:

Optimization 不是「增加資源」,而是找到限制系統效能的地方,再對症下藥。

甚至同一套模型與 GPU,也需要透過 Benchmark 比較調整前後的 Latency 與 Throughput,才能知道最佳化到底有沒有真的發生。Google Cloud 目前也建議採用 Benchmark → Tune → Benchmark 的循環驗證方式。我從 GPU、LLM 與 Infrastructure 的實作中,逐漸發現 GPU 並不是 AI Performance 的唯一變數。

現在 Google Cloud 的文件其實提供了一個很好的佐證:Inference Quickstart 會把 TTFT、NTPOT、Throughput、Queue Size、KV Cache 等資料一起 benchmark,找出 throughput 開始飽和、latency 開始惡化的區域,而不是簡單用「GPU utilization 越高越好」判斷效能。

所以問題來了:

當 AI Service 變慢時,我們是在真正解決 Bottleneck,還是只是用更多昂貴的 GPU 掩蓋問題?

這也是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》想討論的核心:Production Engineering 不只是把資源加上去,而是找到效能、成本與使用體驗之間合理的平衡點。正是因為GPU、RAM的需求缺口與價格高漲,我們更應該真正找出如果 AI 服務變慢,要怎麼找出真正問題?如何針對問題對症下藥?

關於作者

我是一名 AI × Infrastructure Solution / Integration 技術實作者,專注於 AI、MLOps、Cloud、Docker、Kubernetes、GPU、LLM 與 AI Agent 等技術的整合與落地,跨足 LLM、GPU、Docker、Kubernetes、MLOps 與 AI Agents,持續研究企業 AI 從 Prototype 到 Production 所需要的工程能力。協助企業理解 AI 從 Prototype 到 Production 所需要的技術能力。

本系列同時是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》的延伸實戰筆記。如果想完整理解這些更深的技術問題,未來可以去看這本書(書中包含了一些的範例與提示詞,特別是AMD W7900 48G的使用技術心得,這些是外面很少有的獨家踩坑經驗,未來買書真的賺到!)。敬請期待唷~


上一篇
Day 25 如果AI 變慢,我該先看 GPU、Model 還是 Network?
下一篇
Day 27 如果AI Service 掛掉了,Production 應該怎麼辦?
系列文
AI Demo上 Production 之前:AI × Infrastructure 實戰筆記30
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言