資訊基準日:2026-09-08。本文是《看懂本地 LLM 的「模型參數」》的姊妹篇:前一篇教你從檔名算出一顆模型要多少記憶體,這一篇把那個數字對到一台實際能買到的 Mac。
選 Mac 跑本地 LLM,最後只落在兩件事:RAM 決定裝不裝得下,頻寬決定跑多快。 Qwen3.8-27B 的 Q4 權重檔約 16.5 GB,加 KV cache(Key-Value cache)後 32 GB 機器是甜點檔;753B 的 MoE(Mixture of Experts,專家混合)模型 Q4 權重約 466 GB,要 512 GB 的機器才裝得下,而且已是硬塞級、超過 75% 舒適線。2026-08-25,Apple 在同一天發布了 Mac mini 的 M6/M5 Pro 與 Mac Studio 的 M5 Max/M5 Ultra 兩條線,2026-09-22 開賣;512 GB 的 M5 Ultra 還要等到 10 月底供貨。交貨之前,市面上所有 M6 與 M5 Ultra 的速度數字都是推算。
選 Mac 跑本地 LLM 的核心理由只有一個:統一記憶體(unified memory)。
Apple 對它的官方定義是「高頻寬、低延遲的記憶體,置於單一封裝內、組成單一記憶體池,CPU、GPU、Neural Engine 存取同一份資料、不需要複製」(M1 新聞稿)。關鍵在「單一記憶體池」:GPU 用的就是你裝給整台電腦的 RAM。
對比傳統獨立顯示卡:顯存(VRAM)做在卡上,容量固定、買定離手。753B 這種 MoE 模型(GLM-5.x 的 Q4 權重約 466 GB,unsloth 檔案樹)在消費級獨立 GPU 上沒有對應的卡可買,在 512 GB 的 Mac 上卻能整顆載入。Apple 自己就這樣定位 Mac Studio:「run enormous LLMs entirely on device」,也就是在裝置上完整執行巨型 LLM(Apple 新聞稿)。
代價是共用。OS、所有 app、模型權重、KV cache 全從同一個池子拿,所以前一篇那條 75% 線(模型總需求壓在總記憶體的 75% 以內)在 Mac 上尤其重要。
token 生成的主要動作是反覆從記憶體讀權重。權重一次要讀的位元組數幾乎固定,能讀多快就決定生得多快。社群與基準測試的結論一致:記憶體頻寬是 Apple Silicon 跑 LLM 速度的第一預測因子(LLMCheck)。
實測錨點全部用同一顆 Qwen3-8B Q4_K_M(llama-bench 的 decode tok/s,Macfax 社群實測,Secure-Enclave 簽署),同一模型跨機、才比得起來:
| 機型 | 8B Q4(tok/s,實測) |
|---|---|
| M3 Ultra 512 GB(停售) | 95.8 |
| M5 Max 64 GB | 93.2 |
| M4 Max(停售) | 83.9 |
| M4 16–32 GB(停售) | 20.0 |
(Macfax 每個數字都附 Secure-Enclave 簽署與測量次數;M5 Max 64 GB 那格是 3 次 93.1–98.5。)
小模型上頻寬差距直接寫進速度:M3 Ultra 的 800 GB/s 跑出 95.8 tok/s,M4 的 120 GB/s 只有 20.0 tok/s,差約五倍,跟頻寬差(6.7 倍)同一量級。但比較頻寬最高的 M3 Ultra(800 GB/s)與次高的 M5 Max(614 GB/s),8B 差距只剩 3%。token 生成在小模型上已卡到記憶體批次讀取的天花板,多餘的頻寬幫助有限。
753B 級是另一回事:GLM-5.2 Q4_K_M 在 M3 Ultra 512 GB 的 decode 實測約 15 tok/s(LLMCheck 社群實測),這是目前唯一實測的 753B 級速度錨點。Apple 另外給了一組預告倍數:LM Studio 的 prompt(prefill)處理,M5 Ultra 比 M1 Ultra 快 9.8 倍、比 M3 Ultra 快 4 倍(Apple Mac Studio 新聞稿)。兩者語境不同(M3 Ultra 的 decode 實測 vs M5 Ultra 的 prefill 預告),不能直接換算;M5 Ultra 交貨前,15 tok/s 仍是你唯一可以信的 753B 數字。
新機型的推算值(LLMCheck 速算,2026-08/09;9/22 前無實機,除標「實測」者外皆推算):
| 機型 | 8B Q4 | 9B Q4 | 14B Q4 | 27B Q4 | 70B Q4 | 106B MoE | 753B MoE |
|---|---|---|---|---|---|---|---|
| M6 16–32 GB | 29 | 26 | 17 | 8 | – | – | – |
| M5 Pro 24–64 GB | – | – | – | 14 | – | – | – |
| M5 Max 36–128 GB | 91 | 82 | 55 | 30 | 12 | 34(128 GB) | – |
| M5 Ultra 96–512 GB | – | – | – | 57(96 GB) | 24(96 GB) | 61(96 GB) | 17(512 GB)/29(256 GB,Q2) |
(M5 Pro 的 27B 是 LLMCheck 收錄的 Qwen 3.6-27B(M5 Pro 24 GB,MLX)推 14;M5 Max 的 27B 是 Qwen 3.6-27B(64 GB)推 30;753B 的 512 GB 行是 GLM-5.3 Q4_K_M 推 17 tok/s,256 GB 行是 GLM-5.3 Q2_K 推 29 tok/s。欄位把同參數規模的多顆模型彙整在一起,欄內數字可能因此略有出入,例如 M5 Max 的 8B:此表 91 是 128 GB 配置的推算、上表 93.2 是 64 GB 配置的實測,欄位匯整了不同 RAM 檔位與引擎的數字,小幅出入正常;要做嚴格單模型跨機比較,只有上表 Macfax 的 Qwen3-8B 是「同一顆、同一引擎、同一量法」的錨點。)
兩點觀察。第一,小模型時,機型差就是頻寬差:M6 的 153 GB/s(16 GB 配置)跑 8B 約 29 tok/s,M5 Ultra 的 1.2 TB/s 不會讓 8B 快七倍,因為 8B 在 64 GB M5 Max 上已達 93 tok/s 的批次讀取天花板。第二,買 M5 Ultra 買的是容量與大模型速度:753B 級 Q4 只在 512 GB 上跑得動;27B 級以下則用 mini 就夠。
2026-08-25 發布的兩條線(Apple Mac mini 新聞稿、Apple Mac Studio 新聞稿):
| 產品線 | 晶片 | CPU/GPU | RAM 檔位 | 頻寬 | 狀態 |
|---|---|---|---|---|---|
| Mac mini | M6 | 12 核 CPU/12 核 GPU,雙 16 核 NE | 16/24/32 GB | 153 GB/s(16 GB)/170 GB/s(24/32 GB) | 預購中(9/22 開賣) |
| Mac mini | M5 Pro | 最高 18 核 CPU/最高 20 核 GPU | 24/48/64 GB | 307 GB/s | 預購中(9/22 開賣) |
| Mac Studio | M5 Max | 18 核 CPU/最高 40 核 GPU | 36/48/64/128 GB | 460 GB/s(36 GB)/614 GB/s(48/64/128 GB) | 預購中(9/22 開賣) |
| Mac Studio | M5 Ultra | 最高 36 核 CPU/最高 80 核 GPU | 96/256/512 GB | 1.2 TB/s | 512 GB 檔 10 月底供貨 |
(M6 是 Apple 第一顆 2nm 晶片;M5 Ultra 是第一個 quad-die 封裝。M5 Pro 的 CPU 核數,新聞稿寫「最高 18 核」、官方首頁寫「最高 14 核」,本文以發布日新聞稿為準。)


關鍵差異有三:



官方同時給了一組 LM Studio prompt 處理的倍數(與前代同型號比較,全部為預告數據,Apple 新聞稿):
注意這些是 prompt 首 token(prefill)速度,不是生成速度;生成速度仍由記憶體頻寬主導。

來源:Apple Mac Studio 2026 新聞稿。圖內速度為 Apple 預告的數據,與上文「全部為預告數據」的備註一致。
| 世代(發布) | 晶片 | 頻寬 | RAM 上限 |
|---|---|---|---|
| Mac mini 2020-11 | M1 | 68.25 GB/s | 16 GB |
| Mac mini 2023-01 | M2 | 100 GB/s | 24 GB |
| Mac mini 2023-01 | M2 Pro | 200 GB/s | 32 GB |
| Mac mini 2024-10 | M4 | 120 GB/s | 32 GB |
| Mac mini 2024-10 | M4 Pro | 273 GB/s | 64 GB |
| Mac Studio 2022-03 | M1 Max | 400 GB/s | 64 GB |
| Mac Studio 2022-03 | M1 Ultra | 800 GB/s | 128 GB |
| Mac Studio 2023-06 | M2 Max | 400 GB/s | 96 GB |
| Mac Studio 2023-06 | M2 Ultra | 800 GB/s | 192 GB |
| Mac Studio 2025-03 | M4 Max | 410–546 GB/s | 128 GB |
| Mac Studio 2025-03 | M3 Ultra | 800 GB/s | 512 GB |
(數據出處:Wikipedia Apple M1、2022 Studio 新聞稿、2023 mini 新聞稿、2023 Studio 新聞稿、2024 mini 新聞稿、2025 Studio 新聞稿、M6/M5 Ultra 晶片新聞稿。)
注意 2025 代的 M4 Max(最高 546 GB/s)頻寬比 2023 代的 M2 Ultra(800 GB/s)低,速度也確實較慢:同一顆 8B,M4 Max 128 GB 實測 83.9 tok/s,M3 Ultra 是 95.8 tok/s。買二手時,同代內頻寬比 RAM 更影響速度;跨代時 M4 Max 對 M2 Ultra 是「新而慢」的取捨。表內 410–546 GB/s 區間取自 Apple Mac Studio(2025)官方規格頁:14 核 M4 Max 為 410 GB/s,16 核為 546 GB/s。
前一篇的方法:權重加 KV 的總需求,壓在總記憶體的 75% 以內,才留得出 OS 與其他 app 的空間。下表把現行兩條線的每個 RAM 檔位對到 2026 現行模型(75% 線=總記憶體 × 0.75 向下取整)。
| 機型 | 總記憶體 | 75% 線 | 對 2026 模型 |
|---|---|---|---|
| M6 mini | 16 GB | 12 GB | 放得下 9B Q4(約 6 GB 加小 context),再大就吃緊 |
| M6 mini | 24 GB | 18 GB | 27B Q4(檔約 16.5 GB)加短 context 壓線,邊界配置 |
| M6 mini | 32 GB | 24 GB | 27B Q4 加中長 context 的甜點檔 |
| M5 Pro mini | 24/48/64 GB | 18/36/48 GB | 48 GB 起 27B 舒適,64 GB 放得下 70B 級 Q4(約 42 GB) |
| M5 Max Studio | 64/128 GB | 48/96 GB | 128 GB 放得下 70B Q4 加長 context,或 106B 級 MoE 的 Q4(約 60 GB) |
| M5 Ultra Studio | 96/256/512 GB | 72/192/384 GB | 96 GB 放得下 70B 級 Q4(約 42 GB)加較長 context;512 GB 是唯一放得下 753B 級 Q4(約 466 GB 加 KV)的檔;256 GB 只能降到 Q2(LLMCheck 收錄M5 Ultra 256 GB 跑 GLM-5.3 Q2 估算 29 tok/s) |
兩類模型的對應邏輯不同:
實例走一遍:想跑 Qwen3.8-27B、以日常對話為主、可接受 8–15 tok/s。Q4 權重 16.5 GB 加短 KV 約 18–20 GB,壓在 75% 線(32 GB 檔=24 GB)內。M6 mini 跑 27B Q4 的估算值約 8 tok/s(LLMCheck 收錄,交貨前所有數字皆為推算);M5 Pro 的頻寬 307 GB/s 約是 M6 的 1.8–2 倍,同模型只會更快。就這個需求,32 GB 的 M6 mini 就夠用。想跑 GLM-5.3 級(Q4 約 466 GB)才是另一回事:唯一選項是 512 GB 的 M5 Ultra,256 GB 只能降到 Q2。
以下三則來自社群實測報告的真實事故,每則對應一個選購或設定動作。
1. OOM/swap 凍結:權重塞不進 RAM。 一台 16 GB 的 Mac mini 用 Ollama 跑 Qwen 3.5 35B-A3B(MoE),Ollama 預載全部 26 GB 權重,系統凍結、430 萬次 swapout、10 分鐘 0 token;改用 llama.cpp 的 --mmap 後 17.3 tok/s、記憶體空閒 81%、零 swap(jock.pl 實測)。選購含義:RAM 不夠就換機器或降量化;引擎的載入策略(整包預載 vs mmap 按需讀取)可以決定一顆模型是「跑得動」還是「把機器拖死」。
2. KV cache 預先分配爆掉。 llama.cpp 會預先為「全部 context」分配 KV 空間:QwQ 32B 4-bit 的權重只有約 19 GB,但滿 context 預載時峰值可達約 51 GB;DeepSeek R1 4-bit 在 256 GB 的 M3 Max 和 RTX 5090 上都 OOM,只有 512 GB 的 M3 Ultra 跑得動(19.69 tok/s)。MLX 的 KV 是按需分配,同機同模型記憶體佔用小得多(Creative Strategies 實測)。設定含義:用 llama.cpp 跑長 context 時,KV 是記憶體帳單上的隱藏大戶;要嘛壓短 context、要嘛換 MLX 同款模型。
3. macOS 的 GPU 記憶體上限擋住載入。 一台 128 GiB 的機器,macOS 預設只把約 107.5 GiB 給 Metal 當 working set,模型超過就載入失敗。解法是 sudo sysctl iogpu.wired_limit_mb=114688(約 112 GiB),在 M5 Max 128 GB(macOS 27 beta)上驗證有效(antirez/ds4 PR #909);同一問題在 macOS 27 beta 上仍然存在,oMLX 的錯誤訊息會直接提示你調這個值(autohand/code-cli #558)。設定含義:選 256/512 GB 跑大模型時,載入前先檢查 Metal 上限,別把「macOS 擋下的」誤判成「模型裝不下」。
另有一則是固有特性而非 bug:prefill 慢、decode 快。 同一顆 Llama-3.1 8B,M3 Ultra 的 prefill 是 5.57 秒、NVIDIA DGX Spark 只要 1.47 秒(NVIDIA 快約 3.8 倍);但 decode 端反過來,M3 Ultra 是 0.85 秒、DGX Spark 要 2.87 秒(Mac 快約 3.4 倍)(exolabs 對測)。想要的體驗是「快速回答」用 Mac;「大批量長文一次塞進去跑」則 NVIDIA 路線值得評估。
從「我想跑某顆模型」反推到「我該買哪個配置」,先定你要跑的模型、context 多長、什麼量化,算出模型加 KV 的總需求;確認壓得進 75% 線,再用第二節的頻寬表與速查表選出速度符合預期的機型;裝不下就降量化或升 RAM 檔位。

選型決策流程:先算模型加 KV 的總需求,壓得進 75% 線再選機器;裝不下就降量化或升 RAM 檔位。
先買機再想跑什麼,往往卡在記憶體不夠,而 RAM 是買定離手的。2026-09-22 開賣前,M6 與 M5 Ultra 的所有速度數字都是推算;9/22 開賣後、10 月底 512 GB 供貨前,實測數據會陸續到位,屆時可以回查本文的推算值。