資訊基準日:2026-09-01。本文是規格篇;Mac Studio 的檔位推薦與統一記憶體詳解會在下一篇選購指南。
一段時間沒看檔名,發現它已經變成天書:Nemotron-Mini-4B-Instruct-IQ3_M.gguf 2.18 GB。這串字不是亂碼,是一張規格表。看懂它只需要三件事:參數量(B)、精度(量化,Q 那一串)、檔案格式。而這三件事的最終答案是一句話:你的電腦要裝多少記憶體(RAM)才跑得動這個模型。
本文不講 Transformer 內部結構,只教你拆檔名。讀完你會自己算出任何模型的記憶體需求,不必背任何人的推薦表。

來源:bartowski/Nemotron-Mini-4B-Instruct-GGUF(Hugging Face)。同一顆 4B 模型,檔名只差幾個字,大小差了近 4 倍。
B 就是 billion,「4B」代表 40 億個參數。參數是模型內部學習到的權重,你可以把它想成神經元之間的連接強度;參數越多,模型通常越會,但只論通常。
參數量最直接決定一件事:模型「原本」要佔多少空間。原廠沒壓縮的權重通常用 16-bit 浮點(F16)存,每個參數約 2 bytes,所以:
檔案大小 ≈ 參數量 × 2 bytes
套在 Nemotron-Mini-4B 上:40 億 × 2 = 8 GB。實際的 F16 檔正是 8.388 GB(bartowski 社群量測)。8 和 2.18 之間的差距,就是量化吃掉的部分。
參數量也不是能力的全部:NVIDIA 的 Minitron-4B 從 15B 剪枝蒸餾而來,用少了 40 倍的訓練資料量,反而在 MMLU 贏過參數量更大的模型(官方模型卡)。所以「4B 一定輸 8B」不成立,訓練品質同樣要算。
2026 年的新模型卡上,參數字串出現新的寫法:「753B-A40B」。這是 MoE(Mixture of Experts,混合專家)架構的記法:總參數 753B,但每次生成只會用到 40B(激活參數)。
| 模型(2026 官方卡) | 總參數 | 激活參數 | 格式 |
|---|---|---|---|
| GLM-5.3 | 753B | 40B | MoE(官方 repo 標 744B-A40B,README) |
| GLM-5.3-Flash | 320B | 18B | MoE+多模態 |
| Qwen3.8-Flash-Next | 180B | 6B | MoE(Qwen4 實驗預覽) |
| Qwen3.8-27B | 27B | 27B | Dense(全部參與) |
MoE 把參數切成幾百個「專家」,每個 token 只叫醒少數幾個。所以記憶體需求看總參數(檔案要全部裝進記憶體),運算速度看激活參數(每次只算這幾個專家)。這解釋了為什麼 753B 的檔案不會是 8B 模型的近 100 倍速度之差:檔案大很多,但每次運算沒有慢 100 倍。
對你選硬體來說,總參數才是記憶體的依據;激活參數只影響跑不跑得順。2026 年的旗艦本地模型幾乎都是 MoE(GLM-5.3 753B-A40B、Qwen3.8-Flash-Next 180B-A6B、GLM-5.3-Flash 320B-A18B),因為它用「檔案很大、每次跑得不多」換到接近大模型的品質——前提是你買得起那份記憶體。
量化(quantization)就是用更少的 bit 存每個參數,把 F16(16-bit)降到 8-bit、4-bit、3-bit、2-bit。代價是精度損失,換來的是一個裝得下的檔案。
llama.cpp 官方文件給了一張 Llama-3.1-8B 的完整對照表(tools/quantize README),摘錄幾個熟的:
| 量化 | 每參數 bit 數 | 8B 檔案大小(官方量測,GiB) |
|---|---|---|
| F16 | 16.00 | 14.96 GiB |
| Q8_0 | 8.50 | 7.95 GiB |
| Q4_K_M | 4.89 | 4.58 GiB |
| IQ4_XS | 4.46 | 4.17 GiB |
| IQ1_S | 2.00 | 1.87 GiB |
品質損失用 perplexity(困惑度,越低越好)量測,官方文件同一份有數據。多數社群指南把 Q4_K_M 一類的 4-bit 配方當品質與大小的平衡點(macstudios.net);真的嫌大檔時再往下探:IQ1_S 這種 2-bit 級別(1.87 GiB)品質明顯下降,只適合記憶體極度拮据的場合。

你看到的 Q3_K_L、IQ4_XS、IQ3_M 都是「量化配方」的名字。開頭那串天書其實只有五段,拆開讀:

Q8_0=8-bit。Q4_K_M 表示以 4-bit 為主的混合配方。Q3_K_S(3.64 bpw)比 Q3_K_L(4.30 bpw)小一截(官方 8B 對照表)。不確定的話選 Q4_K_M 或 IQ4_XS 最穩(macstudios.net 的推薦起點)。所以 IQ3_M=用重要性矩陣的 3-bit 中型配方,這正是你看到 2.18 GB 那份檔(F16 的 8.388 GB 縮到 26%)。S/M/L/XL 的差異是 per-tensor bit 分配比例(官方表:Q3_K 系列 3.64/4.00/4.30 bpw),品質差異官方沒有絕對結論,留待自己實測。
GGUF 只是目前本地推理最常碰到的格式之一。格式決定你用什麼工具載入它,不改變模型本身的智慧。
| 格式 | 生態 | 用在哪 |
|---|---|---|
| GGUF | llama.cpp 生態(Ollama、LM Studio 都吃) | 本地推理的通用格式,一個檔含權重+metadata(官規格) |
| safetensors | Hugging Face 生態 | 模型卡上的原始權重檔,訓練/微調用(例如 Qwen3.8-27B 卡上即以此格式釋出) |
| MLX | Apple Silicon 專用 | Mac 上最佳化的推理格式(Starmorph 實測指南) |
此外還有其他格式。重點:同一模型能有好幾種格式副本,檔案大小大致相近(同為 Q4 時),選哪個取決於執行工具,與模型本身的品質無關。
補充一個 2026 現況(unsloth 檔案樹):GLM-5.x 目前只有 GGUF,沒有 MLX 轉換版;Qwen3.8-27B 則連 MLX 版都有。買 Mac 前先確認你要的模型有沒有 MLX 版,有的話速度有差。
記憶體需求不是檔案大小那麼簡單。跑起來時三塊疊加:


舉三個實例(都只算權重+KV,不計系統):
| 模型 | 量化 | 權重檔 | 粗估總需求 | 建議記憶體 |
|---|---|---|---|---|
| Nemotron-Mini-4B | IQ3_M | 2.18 GB(bartowski 實測 2.184 GB) | ~3 GB | 8–16 GB |
| Qwen3.8-27B | Q4_K_M | 16.5 GB(unsloth) | ~21 GB | 32 GB |
| GLM-5.3 | Q4 級 | ~470 GB(同為 753B-A40B 的 GLM-5.2 Q4 實測 466 GB,unsloth;GLM-5.3 同規模推估同級) | ~500+ GB | 512 GB(超過 75% 舒適線,屬硬塞級) |
SSD 要不要大容量? 要,但理由不是速度。模型檔很大(上面 GLM 那顆就快半 TB),SSD 首先得裝得下、而且你想同時放好幾顆模型。載入時 SSD 速度影響一次性的啟動時間,跑起來之後(llama.cpp 用 mmap 按頁讀取)SSD 不再是瓶頸(jock.pl 實測)。該實測有個關鍵細節:16 GB 機器硬塞 26 GB 權重會凍結,改用 mmap 後 17.3 tok/s、記憶體空閒 81%。這來自 mmap 只把用到的權重頁載入記憶體,其餘留在 SSD;取捨在讓模型進得了記憶體,SSD 快慢只影響啟動那一次。
先把「我要跑幾 B、用什麼量化」定下來,這決定記憶體需求;再用需求倒推機器。看到 512 GB、256 GB、128 GB 這些檔位時,記得回頭對照 75% 舒適線:GLM-5.3 那級(~500 GB)在 512 GB 上是硬塞,算起來挺緊的。Mac 的統一記憶體架構能載入比顯卡 VRAM 大得多的模型,以及「各檔位到底該選哪顆模型」的具體對照表與 2026 現行 Mac Studio 配置,會在下一篇選購指南。
iThome鐵人賽