我有多年 IT 技術與跨域學習經驗,現在把 AI、Cloud、Infrastructure 串起來。
前幾天談完 GPU、VRAM 與模型之後,我開始思考另一個很實際的問題:如果模型已經成功在我的電腦上跑起來,為什麼換一台電腦,卻可能突然不能跑?
以前寫一般程式時,我也遇過「在我的電腦可以執行」的情況。但開始接觸 AI/ML 後,我發現這個問題更加複雜。Python 版本、套件版本、深度學習 Framework、GPU Driver、CUDA 或其他 Runtime,甚至模型檔案本身,都可能影響最後的結果。
我自己在 AI 實作過程中,也逐漸體會到:模型能跑,不代表環境是可重現的。
如果今天把一個 AI Demo 交給另一位工程師,他卻無法在自己的環境啟動;或者從本機搬到 Cloud 後,因為 Runtime 或 Dependency 不同而出錯,那麼這個 Demo 距離 Production 其實還有一段距離。
Google Cloud 目前也強調,將模型、Inference Server 與 dependencies 一起封裝成 Container,可以建立更一致、可攜的執行環境,降低環境不一致造成的問題。或是使用colab統一線上端的demo,目的就是減少 dependency mismatch 與環境不一致造成的錯誤。
所以問題來了:
如果 AI Demo 只能在「我的電腦」上成功,那它真的算是一個可以交付的 AI 系統嗎?
這也是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》接下來要討論的問題:如何讓 AI 的執行環境也成為可以被管理、複製與部署的 Infrastructure。如果 AI Demo 只能在「colab」上成功,那它真的算是一個可以交付的 AI 系統嗎?
關於作者
我是一名 AI × Infrastructure Solution / Integration 技術實作者,專注於 AI、MLOps、Cloud、Docker、Kubernetes、GPU、LLM 與 AI Agent 等技術的整合與落地,跨足 LLM、GPU、Docker、Kubernetes、MLOps 與 AI Agent,持續研究企業 AI 從 Prototype 到 Production 所需要的工程能力。協助企業理解 AI 從 Prototype 到 Production 所需要的技術能力。
本系列同時是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》的延伸實戰筆記。如果想完整理解這些更深的技術問題,未來可以去看這本書(書中包含了一些的範例與提示詞,特別是AMD W7900 48G的使用技術心得,這些是外面很少有的獨家踩坑經驗,未來買書真的賺到!)。敬請期待唷~