iT邦幫忙

2026 iThome 鐵人賽

DAY 12
0
Build on Google AI

AI Demo上 Production 之前:AI × Infrastructure 實戰筆記系列 第 12

Day 12 AI 在我電腦上可以跑,為什麼換台電腦就壞了?

  • 分享至 

  • xImage
  •  

我有多年 IT 技術與跨域學習經驗,現在把 AI、Cloud、Infrastructure 串起來。

AI 在我電腦上可以跑,為什麼換台電腦就壞了?

前幾天談完 GPU、VRAM 與模型之後,我開始思考另一個很實際的問題:如果模型已經成功在我的電腦上跑起來,為什麼換一台電腦,卻可能突然不能跑?

以前寫一般程式時,我也遇過「在我的電腦可以執行」的情況。但開始接觸 AI/ML 後,我發現這個問題更加複雜。Python 版本、套件版本、深度學習 Framework、GPU Driver、CUDA 或其他 Runtime,甚至模型檔案本身,都可能影響最後的結果。

我自己在 AI 實作過程中,也逐漸體會到:模型能跑,不代表環境是可重現的。

如果今天把一個 AI Demo 交給另一位工程師,他卻無法在自己的環境啟動;或者從本機搬到 Cloud 後,因為 Runtime 或 Dependency 不同而出錯,那麼這個 Demo 距離 Production 其實還有一段距離。

Google Cloud 目前也強調,將模型、Inference Server 與 dependencies 一起封裝成 Container,可以建立更一致、可攜的執行環境,降低環境不一致造成的問題。或是使用colab統一線上端的demo,目的就是減少 dependency mismatch 與環境不一致造成的錯誤。

所以問題來了:

如果 AI Demo 只能在「我的電腦」上成功,那它真的算是一個可以交付的 AI 系統嗎?

這也是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》接下來要討論的問題:如何讓 AI 的執行環境也成為可以被管理、複製與部署的 Infrastructure。如果 AI Demo 只能在「colab」上成功,那它真的算是一個可以交付的 AI 系統嗎?

關於作者

我是一名 AI × Infrastructure Solution / Integration 技術實作者,專注於 AI、MLOps、Cloud、Docker、Kubernetes、GPU、LLM 與 AI Agent 等技術的整合與落地,跨足 LLM、GPU、Docker、Kubernetes、MLOps 與 AI Agent,持續研究企業 AI 從 Prototype 到 Production 所需要的工程能力。協助企業理解 AI 從 Prototype 到 Production 所需要的技術能力。

本系列同時是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》的延伸實戰筆記。如果想完整理解這些更深的技術問題,未來可以去看這本書(書中包含了一些的範例與提示詞,特別是AMD W7900 48G的使用技術心得,這些是外面很少有的獨家踩坑經驗,未來買書真的賺到!)。敬請期待唷~


上一篇
Day 11 同一個 AI 模型,Training 和 Inference 為什麼需要不同的 GPU??
下一篇
Day 13 如果會Docker run, Docker 真的能解決「在我的電腦可以跑」嗎?
系列文
AI Demo上 Production 之前:AI × Infrastructure 實戰筆記14
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言