iT邦幫忙

2026 iThome 鐵人賽

DAY 9
0
AI Engineering

30 天打造 Edge AI Product:一個 PM 從 0 到 1 的 AI Engineering 實戰系列 第 9

NPU 很快,為什麼整條 Pipeline 還是會慢?

  • 分享至 

  • xImage
  •  

前面兩天我們處理了 Model、QNN、HTP。

到這裡看起來好像事情差不多完成了。

但實際跑起來,我們很快發現:

NPU 快,不代表整個 AI Application 快。

因為一張影像從 Camera 到 Event,中間其實還有很多事情。

RTSP
 ↓
Decode
 ↓
Pre-processing
 ↓
QNN / HTP
 ↓
Post-processing
 ↓
Rule
 ↓
Event

真正要優化的不是只有 Inference,而是整條 End-to-End Pipeline。
https://ithelp.ithome.com.tw/upload/images/20260922/20183425RXI6yTh3m7.jpg
https://ithelp.ithome.com.tw/upload/images/20260922/20183425b5ms15TZLu.jpg

Pre-processing

Camera 進來是 1080p,但 Model 可能只吃 640×640。

所以中間還要做:

Resize
Color Convert
Normalize
Tensor Convert

如果這些全部丟給 CPU,NPU 再快也沒用。

Inference

這一段就是 Qualcomm HTP/NPU 發揮的地方:

Input Tensor
     ↓
QNN
     ↓
HTP
     ↓
Output Tensor

這也是我們看到 2.7 FPS → 約 31 FPS 主要的加速來源。

Post-processing

但 NPU 出來的不是「Person」。

它通常是一堆 Tensor。

我們還要繼續處理:

Tensor
 ↓
Decode
 ↓
Confidence Filter
 ↓
NMS
 ↓
Class Filter
 ↓
Bounding Box

最後才知道:

這裡有一個 Person。

再往後才是我們產品自己的:

Person
 ↓
Geofence
 ↓
Intrusion
 ↓
Event
 ↓
Alert

所以這一天我開始把效能問題換一個方式看:

不要只看 Model FPS,要看整條 End-to-End Pipeline。

NPU 只是其中一段。

真正的 Edge AI Product,是:

Video → AI → Rule → Event

每一段都有可能成為 Bottleneck。
而下一個問題就很直接了:

如果一支 Camera 可以跑,那兩支、三支呢?


上一篇
Model 怎麼真正跑進 Qualcomm NPU?
下一篇
31 FPS 很漂亮,直到我們把第二支 Camera 接上去
系列文
30 天打造 Edge AI Product:一個 PM 從 0 到 1 的 AI Engineering 實戰10
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言