我有多年 IT 技術與跨域學習經驗,現在把 AI、Cloud、Infrastructure 串起來
60 天前,我用一個問題開始這個系列:
(30天完成後,休息了30天,其實留了1篇等著今天來發,意不意外,驚不驚喜?)
AI Demo 明明可以跑,為什麼上不了 Production?
30 天後,我的答案反而比一開始更簡單:因為「模型能跑」只是整個 AI System 的其中一層。
這 30 天,我一路從 GPU、VRAM、模型大小與 Quantization,談到 Runtime、Dependency、Docker、Kubernetes,再往 Scaling、Cost、Observability、Reliability、Security 與 AI Agent 延伸。
這也讓我重新整理自己過去從 Python、AI/ML、Cloud、Container、Kubernetes 到 LLM 與 Agent 的學習與實作經驗。
我逐漸發現,真正困難的從來不是讓一個 AI Demo 成功執行一次,而是讓它明天還能跑、換個環境還能跑、使用者增加還能跑、發生故障能恢復,而且成本、安全與效能仍然可以被控制。
Google Cloud 最新的 Well-Architected Framework,同樣從 Operational Excellence、Security、Reliability、Cost 與 Performance 等不同面向思考真正可以長期運作的系統。
所以現在我認為:
Demo 證明的是「這個想法做得到」;Production 證明的是「這套系統能持續被信任」。
但 30 天結束後,我反而想留下另一個問題:
當 AI 與 Agent 持續快速進化,我們今天認為 Production-ready 的架構,半年後還會 Production-ready 嗎?
這也是我寫《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》這個主題與這一本書真正想繼續探索的問題。
30 天結束了,但從 Demo 走向 Production 的實戰,才正要開始。
https://app.agentmorph.dpdns.org/
這30天,我一路寫文章寫書,用AI寫了上面這個程式,把所寫的內容做了一輪實作!今天才剛要發布出來!
這30天我每天分享一個經驗,把 30 天本身變成經驗也用實作從CLAUDE CODE=>CODX->MANUS=>CURSOR=>Antigravity->CODEX~>AWS
我從與AI討論從零開始開始做完這個DEMO大概花了半天,但花了30天用了本地與雲端大約6千萬token+14000次左右的命令,從零開始重構它
文章寫完本來是已經MANUS上線,真正想用GCP實作上線,但因為之前ADS帳號被盜,我發現我用不了GCP,要用要先刷卡1000USD,因為海外還刷不過,用不了GCP服務...只好跑ads申訴流程,但經過一個月還是解決不了~還在鬼打牆中,因為這是GCP外包給AI的問題,也是我的無奈!
但我還是能用AI照我的計劃從demo到參加比賽到預定的今天順利在今天走向 Production 的實戰正式上線,早鳥權限(EARLY ACCESS),500個付費測試名額,一次性購買解鎖,未來都能用!而它半年後還會 Production-ready 嗎?
關於作者
我是一名 AI × Infrastructure Solution / Integration 技術實作者,專注於 AI、MLOps、Cloud、Docker、Kubernetes、GPU、LLM 與 AI Agent 等技術的整合與落地,跨足 LLM、GPU、Docker、Kubernetes、MLOps 與 AI Agents,持續研究企業 AI 從 Prototype 到 Production 所需要的工程能力。協助企業理解 AI 從 Prototype 到 Production 所需要的技術能力。
本系列同時是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》的延伸實戰筆記。如果想完整理解這些更深的技術問題,未來可以去看這本書(書中包含了一些的範例與提示詞,特別是AMD W7900 48G的使用技術心得,這些是外面很少有的獨家踩坑經驗,未來買書真的賺到!)。預計10月同步上市,敬請期待唷~