iT邦幫忙

0

[AI model] 看懂地端 LLM 的「模型參數」:一組代號,算出你需要多少記憶體

  • 分享至 

  • xImage
  •  

資訊基準日:2026-09-01。本文是規格篇;Mac Studio 的檔位推薦與統一記憶體詳解會在下一篇選購指南。

一段時間沒看檔名,發現它已經變成天書:Nemotron-Mini-4B-Instruct-IQ3_M.gguf 2.18 GB。這串字不是亂碼,是一張規格表。看懂它只需要三件事:參數量(B)、精度(量化,Q 那一串)、檔案格式。而這三件事的最終答案是一句話:你的電腦要裝多少記憶體(RAM)才跑得動這個模型

本文不講 Transformer 內部結構,只教你拆檔名。讀完你會自己算出任何模型的記憶體需求,不必背任何人的推薦表。

https://ithelp.ithome.com.tw/upload/images/20260901/20178110vlf0KVrMDY.png

來源:bartowski/Nemotron-Mini-4B-Instruct-GGUF(Hugging Face)。同一顆 4B 模型,檔名只差幾個字,大小差了近 4 倍。

一、B 是參數量:模型有多大

B 就是 billion,「4B」代表 40 億個參數。參數是模型內部學習到的權重,你可以把它想成神經元之間的連接強度;參數越多,模型通常越會,但只論通常。

參數量最直接決定一件事:模型「原本」要佔多少空間。原廠沒壓縮的權重通常用 16-bit 浮點(F16)存,每個參數約 2 bytes,所以:

檔案大小 ≈ 參數量 × 2 bytes

套在 Nemotron-Mini-4B 上:40 億 × 2 = 8 GB。實際的 F16 檔正是 8.388 GB(bartowski 社群量測)。8 和 2.18 之間的差距,就是量化吃掉的部分。

參數量也不是能力的全部:NVIDIA 的 Minitron-4B 從 15B 剪枝蒸餾而來,用少了 40 倍的訓練資料量,反而在 MMLU 贏過參數量更大的模型(官方模型卡)。所以「4B 一定輸 8B」不成立,訓練品質同樣要算。

二、Dense 與 MoE:總參數 ≠ 每次都用到的參數

2026 年的新模型卡上,參數字串出現新的寫法:「753B-A40B」。這是 MoE(Mixture of Experts,混合專家)架構的記法:總參數 753B,但每次生成只會用到 40B(激活參數)

模型(2026 官方卡) 總參數 激活參數 格式
GLM-5.3 753B 40B MoE(官方 repo 標 744B-A40B,README
GLM-5.3-Flash 320B 18B MoE+多模態
Qwen3.8-Flash-Next 180B 6B MoE(Qwen4 實驗預覽)
Qwen3.8-27B 27B 27B Dense(全部參與)

MoE 把參數切成幾百個「專家」,每個 token 只叫醒少數幾個。所以記憶體需求看總參數(檔案要全部裝進記憶體),運算速度看激活參數(每次只算這幾個專家)。這解釋了為什麼 753B 的檔案不會是 8B 模型的近 100 倍速度之差:檔案大很多,但每次運算沒有慢 100 倍。

對你選硬體來說,總參數才是記憶體的依據;激活參數只影響跑不跑得順。2026 年的旗艦本地模型幾乎都是 MoE(GLM-5.3 753B-A40B、Qwen3.8-Flash-Next 180B-A6B、GLM-5.3-Flash 320B-A18B),因為它用「檔案很大、每次跑得不多」換到接近大模型的品質——前提是你買得起那份記憶體。

三、Q 是量化:把檔案「壓縮」到裝得下

量化(quantization)就是用更少的 bit 存每個參數,把 F16(16-bit)降到 8-bit、4-bit、3-bit、2-bit。代價是精度損失,換來的是一個裝得下的檔案。

llama.cpp 官方文件給了一張 Llama-3.1-8B 的完整對照表(tools/quantize README),摘錄幾個熟的:

量化 每參數 bit 數 8B 檔案大小(官方量測,GiB)
F16 16.00 14.96 GiB
Q8_0 8.50 7.95 GiB
Q4_K_M 4.89 4.58 GiB
IQ4_XS 4.46 4.17 GiB
IQ1_S 2.00 1.87 GiB

品質損失用 perplexity(困惑度,越低越好)量測,官方文件同一份有數據。多數社群指南把 Q4_K_M 一類的 4-bit 配方當品質與大小的平衡點(macstudios.net);真的嫌大檔時再往下探:IQ1_S 這種 2-bit 級別(1.87 GiB)品質明顯下降,只適合記憶體極度拮据的場合。

https://ithelp.ithome.com.tw/upload/images/20260901/20178110aMNaiZ2G89.png

四、代號細節:K、IQ、S/M/L/XL 各是什麼

你看到的 Q3_K_LIQ4_XSIQ3_M 都是「量化配方」的名字。開頭那串天書其實只有五段,拆開讀:

https://ithelp.ithome.com.tw/upload/images/20260901/201781102Ke2IM7P3Z.png

  • Q 開頭=Quantized(量化過),後面的數字是目標 bit 數。Q8_0=8-bit。
  • K=k-quants,llama.cpp 在 2023 年導入的一族 block-wise 量化(PR #1684):同一模型的不同層可以用不同 bit 數,例如 Q4_K_M 表示以 4-bit 為主的混合配方。
  • IQ=importance-matrix quantized(PR 系列 #4773):先用一份校準資料算出每個參數的「重要性矩陣」(imatrix 文件),不重要的參數可以壓得更狠。同樣 4-bit 級別,IQ 通常更小,但對輸入分佈較敏感。
  • S/M/L/XL=Small/Medium/Large/X-Large,同一家族的尺寸口味:同樣 Q3_K,Q3_K_S(3.64 bpw)比 Q3_K_L(4.30 bpw)小一截(官方 8B 對照表)。不確定的話選 Q4_K_MIQ4_XS 最穩(macstudios.net 的推薦起點)。

所以 IQ3_M=用重要性矩陣的 3-bit 中型配方,這正是你看到 2.18 GB 那份檔(F16 的 8.388 GB 縮到 26%)。S/M/L/XL 的差異是 per-tensor bit 分配比例(官方表:Q3_K 系列 3.64/4.00/4.30 bpw),品質差異官方沒有絕對結論,留待自己實測。

五、同樣的模型,有好幾種檔案格式

GGUF 只是目前本地推理最常碰到的格式之一。格式決定你用什麼工具載入它,不改變模型本身的智慧。

格式 生態 用在哪
GGUF llama.cpp 生態(Ollama、LM Studio 都吃) 本地推理的通用格式,一個檔含權重+metadata(官規格
safetensors Hugging Face 生態 模型卡上的原始權重檔,訓練/微調用(例如 Qwen3.8-27B 卡上即以此格式釋出)
MLX Apple Silicon 專用 Mac 上最佳化的推理格式(Starmorph 實測指南

此外還有其他格式。重點:同一模型能有好幾種格式副本,檔案大小大致相近(同為 Q4 時),選哪個取決於執行工具,與模型本身的品質無關。

補充一個 2026 現況(unsloth 檔案樹):GLM-5.x 目前只有 GGUF,沒有 MLX 轉換版;Qwen3.8-27B 則連 MLX 版都有。買 Mac 前先確認你要的模型有沒有 MLX 版,有的話速度有差。

六、名稱上剩下的字:Instruct、-Flash、context

  • Instruct=instruction-tuned,針對「聽指令」微調過的版本(Nemotron-Mini-4B-Instruct 官方卡)。與之相對的是 Base(預訓練原版)。日常對話用途記得選 Instruct 版;Base 是給想自己繼續訓練的人。
  • -Flash / -Mini / -Next=系列內的不同尺寸或世代定位,不是標準規格,查官方卡最準。例如 Qwen3.8-Flash-Next 是 Qwen4 的開源實驗預覽(官方卡),與 API 版 Qwen3.8-Flash 是兩個東西。
  • context 長度:模型一次能「記得」多少 token。Nemotron 只有 4096;2026 新模型動輒 262K(Qwen3.8-27B)到 1M(GLM-5.3)。長 context 要付記憶體代價,見下節。

七、從檔案大小到記憶體需求:權重 + KV cache + 餘裕

記憶體需求不是檔案大小那麼簡單。跑起來時三塊疊加:

https://ithelp.ithome.com.tw/upload/images/20260901/20178110YltC7wJNWS.png

  1. 權重:量化後的檔案本體(Qwen3.8-27B 的 Q4 是 16.5 GB)。
  2. KV cache:生成時記住「前面看過什麼」的暫存區,隨 context 變長而暴增。公式:每 token 約 2 × layers × KV heads × head_dim × 每個數值佔的 bytes(FP16 為 2);以 70B 模型為例(80 layers、8 KV heads、128 head_dim),每 token 約 320 KB,開 32K context 就要約 10 GB(Contra Collective 計算)。所以「能跑 1M context」和「每個 context 都要 1M」是兩回事,預設短 context 可以大幅省記憶體。另一個細節:llama.cpp 會預先分配整個 context 的 KV 緩衝(實測裡 QwQ 32B 4-bit 本體 19 GB,開滿 context 後佔到 51 GB),而 MLX 按需分配,同樣模型常能少佔一半——引擎選擇也會影響記憶體帳單。
  3. 系統餘裕:作業系統與其他 app 也要記憶體。社群共識是模型總需求最好壓在總記憶體 75% 以內(macstudios.net 指南);具名作者 Simon Willison 的經驗是 18 GB 的模型至少要 32 GB 機器才「留空間給其他程式」(Muse Glimmer 介紹文)。

https://ithelp.ithome.com.tw/upload/images/20260901/201781102gfvg87UFe.png

舉三個實例(都只算權重+KV,不計系統):

模型 量化 權重檔 粗估總需求 建議記憶體
Nemotron-Mini-4B IQ3_M 2.18 GB(bartowski 實測 2.184 GB) ~3 GB 8–16 GB
Qwen3.8-27B Q4_K_M 16.5 GB(unsloth ~21 GB 32 GB
GLM-5.3 Q4 級 ~470 GB(同為 753B-A40B 的 GLM-5.2 Q4 實測 466 GB,unsloth;GLM-5.3 同規模推估同級) ~500+ GB 512 GB(超過 75% 舒適線,屬硬塞級)

SSD 要不要大容量? 要,但理由不是速度。模型檔很大(上面 GLM 那顆就快半 TB),SSD 首先得裝得下、而且你想同時放好幾顆模型。載入時 SSD 速度影響一次性的啟動時間,跑起來之後(llama.cpp 用 mmap 按頁讀取)SSD 不再是瓶頸(jock.pl 實測)。該實測有個關鍵細節:16 GB 機器硬塞 26 GB 權重會凍結,改用 mmap 後 17.3 tok/s、記憶體空閒 81%。這來自 mmap 只把用到的權重頁載入記憶體,其餘留在 SSD;取捨在讓模型進得了記憶體,SSD 快慢只影響啟動那一次。

動手前:三分鐘檢查清單

  • 第一步,定模型:先決定「要跑幾 B、MoE 或 Dense、什麼量化」。本章表格是最快參照。
  • 第二步,查兩個數字:權重檔大小(HF 檔案樹)+你要的 context 長度對應的 KV cache(用上面的公式估)。
  • 第三步,對照 75% 線:權重+KV 的總需求最好壓在記憶體 75% 以內,超過就是硬塞級。
  • 第四步,確認格式:你用的引擎(Ollama/LM Studio/MLX)吃不吃這個檔,MLX 有沒有版。
  • 第五步,看 SSD:權重檔 + 系統 + 你想同時放的模型,全部加總後再留一點空間。

結尾:下一步

先把「我要跑幾 B、用什麼量化」定下來,這決定記憶體需求;再用需求倒推機器。看到 512 GB、256 GB、128 GB 這些檔位時,記得回頭對照 75% 舒適線:GLM-5.3 那級(~500 GB)在 512 GB 上是硬塞,算起來挺緊的。Mac 的統一記憶體架構能載入比顯卡 VRAM 大得多的模型,以及「各檔位到底該選哪顆模型」的具體對照表與 2026 現行 Mac Studio 配置,會在下一篇選購指南。


圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言