我有多年 IT 技術與跨域學習經驗,現在把 AI、Cloud、Infrastructure 串起來。
實做 AI Demo 的時候,我們通常會先問一個問題:「它能不能跑?」
模型成功載入、Prompt 有結果、畫面可以展示,甚至可以讓使用者輸入問題並得到漂亮的回答,這時候很容易產生一種「專案成功了」的感覺。現在可能只需要幾個 Prompt 或幾行程式架構就能讓AI AGENT自動逐步完成。這也讓我開始思考:當 AI與 AI AGENT越來越會寫程式,工程師真正的價值會變成什麼?
但我在接觸 AI Infrastructure 的過程中,開始發現: AI Demo 成功,其實只代表 AI Prototype 通過了第一個關卡而已。一個 AI 專案可能同時涉及模型、資料、API、GPU、Runtime、Container、Cloud 與使用者需求。如果只熟悉其中一個環節,往往很難看見整個系統真正的問題。
當我開始從 GPU、Runtime、Docker、Cloud 與 Kubernetes 等不同層面思考 AI 系統時,才發現真正的 Production 問題完全不同。模型要部署在哪裡?GPU 資源夠不夠?多人同時使用會怎麼樣?服務故障誰會發現?如何監控效能與成本?更新模型時又要如何避免影響既有服務?
我自己的技術學習一直不是只集中在單一領域,而是從程式開發、Python,一路接觸 Cloud、Docker、Kubernetes、GPU、AI/ML 到現在的 LLM 與 AI Agent。過程中我逐漸發現,真正困難的往往不是「某一個技術會不會用」,而是能不能理解不同技術之間如何連接?
這些問題在第一次 AI Demo 時可能完全看不到,卻可能決定一個 AI 專案最後能不能真正被使用。
當你用的TOKEN越多,看的CODE越多,或懂的越多,或經驗越多,你會發現那些號稱打造0元企業級代理(或龍蝦或XXX),免費的最貴!(他圖的是什麼?) 所以我現在看一個 AI 專案,不會只問「模型準不準」或「Demo 漂不漂亮」,而會進一步思考它是否具備從 Prototype 走向 Production 的條件。因此,我認為 AI 時代的工程能力,正在從「把程式寫出來」,逐漸走向「把 AI、Software 與 Infrastructure 整合起來」。
那麼問題來了:
當一個 AI Demo 已經成功,我們到底還缺少哪些東西,才能說它真的準備好上 Production?工程師真正不可取代的能力,究竟會是什麼?
這正是我撰寫《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》時,希望帶讀者一起思考的問題。
關於作者
我是一名 AI × Infrastructure Solution / Integration 技術實作者,專注於 AI、MLOps、Cloud、Docker、Kubernetes、GPU、LLM 與 AI Agent 等技術的整合與落地,跨足 LLM、GPU、Docker、Kubernetes、MLOps 與 AI Agent,持續研究企業 AI 從 Prototype 到 Production 所需要的工程能力。協助企業理解 AI 從 Prototype 到 Production 所需要的技術能力。
本系列同時是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》的延伸實戰筆記。如果想完整理解這些更深的技術問題,未來可以去看這本書(書中包含了一些的範例與提示詞)。敬請期待~