一個剛好發生的完美範例
寫這篇文章的前一天,Alibaba 的 Qwen 團隊把 Qwen3.8-27B 的權重放上了 Hugging Face。這是一款 27.78B 參數的密集模型,它採用 Apache 2.0 授權,而不是更寬鬆的 MIT 授權。模型本身原生支援 262K token 上下文,還具備視覺編碼器,可以理解圖片與影片。NVIDIA 開發者論壇的 DGX Spark 討論版這幾天討論也是熱鬧,我自己也在今天把它拉下來跑了測試。
為什麼一款 27B 模型會讓地端社群這麼關注呢?因為它剛好落在「單機可以認真處理」的甜蜜點上。而要解釋什麼叫認真吃處理,正好可以順便回答本系列最核心的架構問題,128GB 統一記憶體到底解決了那些問題。
今天這篇我們就用 Qwen3.8-27B 當計算範例,把 GB10 這顆晶片拆開來看。
GB10 Superchip:一顆晶片,兩種用途
DGX Spark 的心臟是 NVIDIA GB10 Grace Blackwell Superchip,它並非一張顯卡加一顆 CPU 的設計而已,它其實是把兩個關鍵處理器封裝在一起的單一晶片:
中央處理器為 20 核心 Arm 架構 CPU,由 10 顆 Cortex-X925 效能核心與 10 顆 Cortex-A725 效率核心組成。
繪圖處理器為 Blackwell 架構 GPU,配備第五代 Tensor Core,FP4 稀疏運算峰值約 1 PFLOPS。
記憶體:128GB LPDDR5x,透過 NVLink-C2C 互連讓 CPU 與 GPU 共享同一個實體記憶體空間,頻寬約 273GB/s。
關鍵字是最後一項。傳統架構下,GPU 只能用自己板卡上的 VRAM,資料要先從系統記憶體經 PCIe 搬進 VRAM 才能運算。統一記憶體架構下沒有這個搬運過程,GPU 可以直接定址完整的 128GB。
用 Qwen3.8-27B 來看記憶體耗用的程度
抽象的架構討論之外,我們來實際算一下,一款 27B 級密集模型在不同精度下的權重占用大約是:
只看這張表,你可能會說 4-bit 量化之後消費級顯卡也能跑啊,何必用 128GB 的機器呢?實務上,問題主要會在二個地方出現。
第一個是 KV cache。
Qwen3.8-27B 的原生上下文是 262K token。上下文越長,推論過程中暫存的 KV cache 就越大,長上下文場景下 KV cache 吃掉數十 GB 記憶體是常態。24GB VRAM 的顯卡跑 4-bit 量化模型,權重放進去之後剩下的空間只夠幾千到一兩萬 token 的上下文,那個 262K 的規格根本就是看得到吃不到,你問一個問題,AI 還沒回答完,它就 OOM 記憶體用量爆掉了,等於沒辦法完成你的任何任務。
128GB 的空間,才能讓你可以把長上下文真的用起來,有足夠的記憶體留給上下文和 KV Cache,才能真的可用,這對 RAG、長文件分析與 agentic 工作流是本質性的差異。
第二問題是精度選擇權。
量化是有代價的取捨,尤其在繁體中文這類訓練語料相對少的語言上,過度量化的品質衰退往往比英文基準測試顯示的更明顯。128GB 讓你可以選擇不量化,可使用 BF16 全精度跑 27B 模型綽綽有餘,你可以自己比較 BF16 與 4-bit 的輸出品質再決定,而不是被硬體逼著只能選量化,獲得降低的品質。這個選擇權本身就是價值,但是如果用全權重去跑,這種完整版在這樣 AI 算力比較弱的機器上也會比較慢,合先敘明。
今天的初步實測,Qwen3.8-27B 在 DGX Spark 上以 FP8(30.9 GB)去跑,其中一個組合,生成速度約 15 tokens/s(開啟模型內建的 MTP 投機解碼;未開啟時為 8 tokens/s),模型載入時間約 550 秒。完整的部署過程、多種量化格式比較與繁中品質評估,會在之後我這篇系列文的模型實戰篇詳細展開。
誠實面對頻寬:這台機器的真實瓶頸
講完優點,該講缺點囉。273GB/s 的記憶體頻寬確確實實是 GB10 的限制,它真的比較慢,這個數字放在對手陣營中並不突出,我們看 Apple M 系列 Ultra 等級的頻寬一下子就超過 800GB/s,桌面旗艦獨顯的 GDDR7 頻寬更是以 TB/s 計。
為什麼頻寬這麼重要?LLM 推論的 decode 階段(這就是逐 token 生成的階段)是典型的記憶體頻寬受限工作負載,每生成一個 token 都要把整份啟用中的權重從記憶體讀一遍。頻寬直接決定了你看到文字吐出來的速度。
所以 DGX Spark 的效能特性是不對稱的,prefill(系統去讀入你的提示詞)靠的是運算力,Blackwell 的 Tensor Core 讓它表現亮眼,長提示詞的處理速度很有競爭力。但是 decode 則受制於 273GB/s,逐 token 生成速度不快。這個不對稱性對不同應用的影響完全不同,長文件摘要、RAG 這類吃長輸入、吐短輸出的場景相對吃香,但是即時對話的話,就會感覺到它慢,所以它比較適合當 AI 代理人和訓練用。
之後的推論引擎實測篇,我會用實際測試資料把這個不對稱性說明清楚,今天先把觀念簡單講一下就好,看地端 AI 硬體不能只看記憶體容量,實際上,容量決定你能跑什麼,而頻寬則決定你跑這些任務會多快。
那麼,它的定位是什麼呢?
把上面的分析收攏,DGX Spark 在 2026 年地端 AI 硬體版圖中的定位就清楚了:
GB10 我覺得是不快的推論機器,273GB/s 的頻寬真的太慢。但是呢,它的價值在於幾個重點的交集,足夠大的記憶體讓 70B 級模型全精度推論與 27B 級模型微調成為可能、完整的 CUDA 生態讓幾乎所有工具鏈開箱即用、以及桌面裝置的功耗與體積。再加上機身後方那組 ConnectX-7 網路介面,兩台 Spark 可以透過 100GbE 或 200GbE 直連組成叢集,這為 GB10 用戶的未來擴充留了一條後路。
對本系列的TA,也就是評估在企業或工作室環境導入地端 AI 的人來說,這個定位,簡單地講的話,就是說,如果你的場景是模型實驗、微調開發、長上下文文件處理與資料主權敏感的內部服務,它非常合適。如果你要的是高並發的生產環境推論服務,就絕對不適合了喔。
明天預告
認識了運算核心,明天我們往外走一圈,10GbE 網路、QNAP NAS 與 NFS 集中模型庫的整體規劃。當模型權重動輒 15GB 到 56GB,而你的環境裡不只一台機器要用它們的時候,模型放哪裡這件事情,就從小問題變成架構問題。
我們 Day 3 見囉。
Day 1|為什麼 2026 年是地端 AI 部署元年:系列規劃與硬體總覽
Day 2|DGX Spark GB10 深度解析:128GB 統一記憶體到底解決了什麼問題
Day 3|網路與儲存規劃:10GbE 骨幹、雙 Spark 直連與 NFS 集中模型庫
Day 3|Day 4|開箱之後:DGX OS 初始環境建置與 CUDA、Docker 生態確認