iT邦幫忙

2026 iThome 鐵人賽

DAY 1
0
AI Engineering

128GB 統一記憶體的三十天:DGX Spark 地端 LLM 與生成式 AI 部署實戰系列 第 1

Day 1|為什麼 2026 年是地端 AI 部署元年:系列規劃與硬體總覽

  • 分享至 

  • xImage
  •  

https://ithelp.ithome.com.tw/upload/images/20260814/20141816gz4fzXbCPd.jpg
前言:我們歷經了硬體堪用到軟體搭配終於逐漸成熟的階段

兩年前,如果有人說要在自己家裡或公司機房跑一個能實際工作的大型語言模型,其實滿多人的第一反應是「跑得動嗎」。今天這個問題已經過時了,量化技術讓很多人的家用電腦只要有 NVIDIA RTX 系列 16GB VRAM 以上的顯示卡也能跑較小的地端 AI,中小型企業要用地端 AI 在經費不夠,記憶體大漲與伺服器變貴的情況下,也有小型 AI 工作站、買夠好的顯示卡可以做地端 AI。
2026 年我們碰到的問題變成該怎麼跑比較好 ? 該選哪個模型、哪個推論引擎、哪種量化格式,以及怎麼把這一切整合成一套可以長期維運的基礎架構呢。

促成這個轉變的力量來自兩端。我想說的特別是模型端這邊,開放權重模型在這一年密集爆發,從 Qwen3.x 系列到 Meta 的 Muse Glimmer,從通用聊天模型走向 Agent 專用模型,而且授權條款越來越友善,Apache 2.0 成為主流選擇,企業可以直接商用、微調與再散布。至於 Kimi K3、DeepSeek V4 Pro、Qwen 3.8 Max 等超大參數的地端模型也開放下載了,較適合研究機構、大型企業和雲端業者在資料中心部署用,中小型公司大概沒這個財力和設備能部署那種要吃大量記憶體的模型。

硬體端這邊呢,128GB 統一記憶體等級的裝置把「跑 70B 甚至 120B 模型」從資料中心拉到了桌面,NVIDIA DGX Spark、Apple M 系列與 AMD Ryzen AI Max+ 都在這個市場上有開發者和公司採用。

對台灣的企業 IT 與資安團隊來說,這件事的意義很實際喔,導入 AI 不再必然等於把內部資料送上雲端。合約文件、客戶個資、內部知識庫,這些受個資法與合規要求約束的資料,現在大家都有了留在地端,資料不出境的選項。

這個系列要做的,已經是我的日常實踐,逐步把這個選項從概念變成一套有興趣的人都可以照著做的架構。

接下來三十天,我會以自己實際在跑的環境為基礎,完整走一遍地端 AI 部署的全流程。

所有的效能資料都會是第一手實測,設定檔也會做說明。

本系列的主角硬體

先讓大家認識接下來三十天會反覆出現的角色。

NVIDIA DGX Spark(GB10):本系列的運算核心。GB10 Superchip 整合 Blackwell GPU 與 Grace CPU,最大特點是 128GB 統一記憶體,讓 GPU 可以直接定址完整記憶體空間。這代表 70B 模型的 BF16 全精度推論、120B 模型的量化推論、甚至 QLoRA 微調,都能在這台桌面裝置上完成。它的限制也很明確,記憶體頻寬是瓶頸,這會在後面的實測中出現,我們會誠實面對這件事。

QNAP NAS:儲存與模型庫中樞。動輒數十 GB 起跳的模型權重不適合散落在各台機器的本機碟,本系列參考網路上熱門的 NAS 選項,採用 QNAP NFS 跑 ZFS RAID 的集中模型庫架構,所有運算節點掛載同一份模型目錄,版本管理與快取策略會有專文說明。NAS 上另配有一張 NVIDIA RTX 顯示卡,會在特定場景客串演出。

10GbE 網路:串起以上兩者的要角。從 NFS 掛載讀取模型權重時,網路頻寬直接決定模型載入時間,這也是很多人第一次做集中模型庫時踩到的坑。

Proxmox VE 叢集:支援角色。部分周邊服務與實驗環境會跑在虛擬化平台上,讓主力機器專注於推論與訓練負載。

桌機與筆電:我的工作用機器包括 Mac Air M5 24GB 統一記憶體、Intel 12th i5 處理器的桌機 128GB DRAM + NVIDIA RTX 5060 Ti 16GB,也能夠參與到地端 AI 運算的環節中。

為什麼是地端,而不只是本機呢?

這裡先定義一個貫穿全系列的觀念。很多地端 AI 的教學停在在自己電腦上跑起來,但一套能進入企業環境的地端 AI 架構,要處理的事情不少呢,比方說模型權重要放哪裡、多台機器怎麼共用、服務掛了誰知道、電費划不划算、稽核的時候拿什麼出來給人看等等。

本機能跑是部署地端 AI 的起點,而可維運、可複製、可稽核是我們的終點。這個系列的每一篇,都會盡量同時照顧這兩個層次,提供能執行的指令,也說明這些選擇在我在實作架構中的理由。

明天預告

Day 2 我們從運算核心開始,深度解析 DGX Spark 與 GB10 架構:統一記憶體到底解決了什麼問題、它與傳統獨立顯卡的 VRAM 有什麼本質差異、以及規格表上那個「1 PFLOPS」數字該怎麼正確解讀。

我們明天見囉。

Day 1|為什麼 2026 年是地端 AI 部署元年:系列規劃與硬體總覽
Day 2|DGX Spark GB10 深度解析:128GB 統一記憶體到底解決了什麼問題
Day 3|網路與儲存規劃:10GbE 骨幹、雙 Spark 直連與 NFS 集中模型庫
Day 3|Day 4|開箱之後:DGX OS 初始環境建置與 CUDA、Docker 生態確認


下一篇
Day 2|DGX Spark GB10 深度解析:128GB 統一記憶體到底解決了什麼問題
系列文
128GB 統一記憶體的三十天:DGX Spark 地端 LLM 與生成式 AI 部署實戰4
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

1 則留言

0
Wolke
iT邦研究生 4 級 ‧ 2026-08-15 17:56:39

128GB 統一記憶體把 70B、120B 從資料中心拉到桌面這點真的很有感,還有你把 10GbE NFS、QNAP 集中模型庫、DGX Spark、Proxmox 這條線串起來,整個地端部署的輪廓一下就清楚了;尤其那句資料不出境、把合規和實作一起顧到,讀起來很踏實。我手邊有多的 Lovable 額度想送給有緣人,有興趣可從連結看看我的系列。 https://ithelp.ithome.com.tw/articles/10401174

ivanusto iT邦新手 5 級 ‧ 2026-08-17 09:31:12 檢舉

感謝,你寫的題目和Lovable 也很有趣呢。

我要留言

立即登入留言