本系列以自建地端機房為場域,涵蓋儲存設備、容器、虛擬機Proxmox VE與NVIDIA DGX Spark,記錄一套可複製的維運方法。第一段示範把 Open WebUI、Ollama、ComfyUI、Jellyfin 等開源服務封裝成可安裝、可升級、可驗證的維護用套件,公開打包骨架、CI流程與repo發布。第二段處理AI/GPU 節點與儲存的日常,包含熱與記憶體守護、NFS 模型庫的權限與版本治理、備份還原演練,以及媒體庫外移GCS與S3的雲地整合。第三段以ISO 27001/27701與ITGC角度,以及監控告警、變更紀錄與稽核軌跡的實作範本。所有腳本與範本皆於GitHub repo開源。
前言:基線是「能描述、能比對」的狀態 Day 10 的環境移植,是在一台已經執行過數個實驗配方的 GB10 節點上進行。Engram 分片直接取用本機既有檔案...
系列專案原始碼: ivanusto/gb10-ops (v0.1.0 / v0.2.0) 前情提要: Day 11 完成了雙節點 DGX Spark 的系統...
專案原始碼與完整實作:nfs-model-library 系列專案索引:onprem-ops-30days 集中模型庫的三個真實鬼故事 在 Day...
把估算轉化為實測資料 在大型語言模型(LLM)落地私有地端(On-Premise)的架構中,推論服務冷啟動(Cold Start)與模型權重載入速度是維運的核...
前言:高可用性(HA)是一場講究過半的投票機制 在現代虛擬化架構中,多數人對「高可用性(High Availability, HA)」的直覺是,只要有兩台伺服...
「備份的證據除了看到管理介面上的綠燈,更重要的是還原成功的那一刻。」 備份的證據是還原 在 [Day 15] 中,我把核心 VM 遷移至 NAS 的 N...
前情提要: Day 16 結尾留了一個重大的架構風險揭露:HDP 的備份儲存庫、Day 13 的 AI 模型庫、Day 2 到 Day 8 的容器持久化卷(...
前情提要 Day 17 的 3-2-1-1-0 對照表留下了兩個紅燈:異地的 1 與 不可變的 1。 次要 NAS 與主 NAS 位於同一機房、同一電力迴...
前情提要 截至 Day 18 為止,地端環境中的運算節點、儲存設備與災難復原演練都已具備可重複驗證的資料證據。然而,這些資料目前分散在四個獨立角落:Day...
將日誌與收集到的資料納管 在前一天的進度中,我們將七種不同維度的指標來源接入同一個 Prometheus,每秒採集約 332 個樣本,推估 90 天約累積 3...