iT邦幫忙

0

2026 年 Mac mini 與 Mac Studio 選購指南:本地 LLM 的統一記憶體、頻寬與 RAM 檔位

  • 分享至 

  • xImage
  •  

資訊基準日:2026-09-08。本文是《看懂本地 LLM 的「模型參數」》的姊妹篇:前一篇教你從檔名算出一顆模型要多少記憶體,這一篇把那個數字對到一台實際能買到的 Mac。

選 Mac 跑本地 LLM,最後只落在兩件事:RAM 決定裝不裝得下,頻寬決定跑多快。 Qwen3.8-27B 的 Q4 權重檔約 16.5 GB,加 KV cache(Key-Value cache)後 32 GB 機器是甜點檔;753B 的 MoE(Mixture of Experts,專家混合)模型 Q4 權重約 466 GB,要 512 GB 的機器才裝得下,而且已是硬塞級、超過 75% 舒適線。2026-08-25,Apple 在同一天發布了 Mac mini 的 M6/M5 Pro 與 Mac Studio 的 M5 Max/M5 Ultra 兩條線,2026-09-22 開賣;512 GB 的 M5 Ultra 還要等到 10 月底供貨。交貨之前,市面上所有 M6 與 M5 Ultra 的速度數字都是推算。

一、為什麼是 Mac:統一記憶體

選 Mac 跑本地 LLM 的核心理由只有一個:統一記憶體(unified memory)。

Apple 對它的官方定義是「高頻寬、低延遲的記憶體,置於單一封裝內、組成單一記憶體池,CPU、GPU、Neural Engine 存取同一份資料、不需要複製」(M1 新聞稿)。關鍵在「單一記憶體池」:GPU 用的就是你裝給整台電腦的 RAM。

對比傳統獨立顯示卡:顯存(VRAM)做在卡上,容量固定、買定離手。753B 這種 MoE 模型(GLM-5.x 的 Q4 權重約 466 GB,unsloth 檔案樹)在消費級獨立 GPU 上沒有對應的卡可買,在 512 GB 的 Mac 上卻能整顆載入。Apple 自己就這樣定位 Mac Studio:「run enormous LLMs entirely on device」,也就是在裝置上完整執行巨型 LLM(Apple 新聞稿)。

代價是共用。OS、所有 app、模型權重、KV cache 全從同一個池子拿,所以前一篇那條 75% 線(模型總需求壓在總記憶體的 75% 以內)在 Mac 上尤其重要。

二、速度看頻寬,不看參數

token 生成的主要動作是反覆從記憶體讀權重。權重一次要讀的位元組數幾乎固定,能讀多快就決定生得多快。社群與基準測試的結論一致:記憶體頻寬是 Apple Silicon 跑 LLM 速度的第一預測因子LLMCheck)。

實測錨點全部用同一顆 Qwen3-8B Q4_K_M(llama-bench 的 decode tok/s,Macfax 社群實測,Secure-Enclave 簽署),同一模型跨機、才比得起來:

機型 8B Q4(tok/s,實測)
M3 Ultra 512 GB(停售) 95.8
M5 Max 64 GB 93.2
M4 Max(停售) 83.9
M4 16–32 GB(停售) 20.0

(Macfax 每個數字都附 Secure-Enclave 簽署與測量次數;M5 Max 64 GB 那格是 3 次 93.1–98.5。)

小模型上頻寬差距直接寫進速度:M3 Ultra 的 800 GB/s 跑出 95.8 tok/s,M4 的 120 GB/s 只有 20.0 tok/s,差約五倍,跟頻寬差(6.7 倍)同一量級。但比較頻寬最高的 M3 Ultra(800 GB/s)與次高的 M5 Max(614 GB/s),8B 差距只剩 3%。token 生成在小模型上已卡到記憶體批次讀取的天花板,多餘的頻寬幫助有限。

753B 級是另一回事:GLM-5.2 Q4_K_M 在 M3 Ultra 512 GB 的 decode 實測約 15 tok/s(LLMCheck 社群實測),這是目前唯一實測的 753B 級速度錨點。Apple 另外給了一組預告倍數:LM Studio 的 prompt(prefill)處理,M5 Ultra 比 M1 Ultra 快 9.8 倍、比 M3 Ultra 快 4 倍(Apple Mac Studio 新聞稿)。兩者語境不同(M3 Ultra 的 decode 實測 vs M5 Ultra 的 prefill 預告),不能直接換算;M5 Ultra 交貨前,15 tok/s 仍是你唯一可以信的 753B 數字。

新機型的推算值(LLMCheck 速算,2026-08/09;9/22 前無實機,除標「實測」者外皆推算):

機型 8B Q4 9B Q4 14B Q4 27B Q4 70B Q4 106B MoE 753B MoE
M6 16–32 GB 29 26 17 8
M5 Pro 24–64 GB 14
M5 Max 36–128 GB 91 82 55 30 12 34(128 GB)
M5 Ultra 96–512 GB 57(96 GB) 24(96 GB) 61(96 GB) 17(512 GB)/29(256 GB,Q2)

(M5 Pro 的 27B 是 LLMCheck 收錄的 Qwen 3.6-27B(M5 Pro 24 GB,MLX)推 14;M5 Max 的 27B 是 Qwen 3.6-27B(64 GB)推 30;753B 的 512 GB 行是 GLM-5.3 Q4_K_M 推 17 tok/s,256 GB 行是 GLM-5.3 Q2_K 推 29 tok/s。欄位把同參數規模的多顆模型彙整在一起,欄內數字可能因此略有出入,例如 M5 Max 的 8B:此表 91 是 128 GB 配置的推算、上表 93.2 是 64 GB 配置的實測,欄位匯整了不同 RAM 檔位與引擎的數字,小幅出入正常;要做嚴格單模型跨機比較,只有上表 Macfax 的 Qwen3-8B 是「同一顆、同一引擎、同一量法」的錨點。)

兩點觀察。第一,小模型時,機型差就是頻寬差:M6 的 153 GB/s(16 GB 配置)跑 8B 約 29 tok/s,M5 Ultra 的 1.2 TB/s 不會讓 8B 快七倍,因為 8B 在 64 GB M5 Max 上已達 93 tok/s 的批次讀取天花板。第二,買 M5 Ultra 買的是容量與大模型速度:753B 級 Q4 只在 512 GB 上跑得動;27B 級以下則用 mini 就夠。

三、兩條線的現行配置

2026-08-25 發布的兩條線(Apple Mac mini 新聞稿Apple Mac Studio 新聞稿):

產品線 晶片 CPU/GPU RAM 檔位 頻寬 狀態
Mac mini M6 12 核 CPU/12 核 GPU,雙 16 核 NE 16/24/32 GB 153 GB/s(16 GB)/170 GB/s(24/32 GB) 預購中(9/22 開賣)
Mac mini M5 Pro 最高 18 核 CPU/最高 20 核 GPU 24/48/64 GB 307 GB/s 預購中(9/22 開賣)
Mac Studio M5 Max 18 核 CPU/最高 40 核 GPU 36/48/64/128 GB 460 GB/s(36 GB)/614 GB/s(48/64/128 GB) 預購中(9/22 開賣)
Mac Studio M5 Ultra 最高 36 核 CPU/最高 80 核 GPU 96/256/512 GB 1.2 TB/s 512 GB 檔 10 月底供貨

(M6 是 Apple 第一顆 2nm 晶片;M5 Ultra 是第一個 quad-die 封裝。M5 Pro 的 CPU 核數,新聞稿寫「最高 18 核」、官方首頁寫「最高 14 核」,本文以發布日新聞稿為準。)

https://ithelp.ithome.com.tw/upload/images/20260909/20178110BYkMZZpvhv.jpg

來源:Apple M6/M5 Ultra 晶片新聞稿.

https://ithelp.ithome.com.tw/upload/images/20260909/20178110EjYpK4rzcT.jpg

來源:Apple Mac Studio 2026 新聞稿.

關鍵差異有三:

  1. 容量天花板。 mini 最高 64 GB,Studio 最高 512 GB。70B 級 Q4(約 42 GB)是 mini 的極限檔;753B 級只有 512 GB 的 Studio 裝得下。
  2. 頻寬極限。 mini 最高 307 GB/s(M5 Pro),Studio 最高 1.2 TB/s(M5 Ultra)。M5 Pro 的 307 GB/s 比 2022 年 M1 Max(400 GB/s)還低,新一代的 Pro 檔在頻寬上接近兩代前旗艦的水位。
  3. 叢集能力。 Studio 新聞稿提到,多台 Mac Studio 可以透過 Thunderbolt 5 與 RDMA(遠端直接記憶體存取)串接做分散式推論,Apple 稱多機串接最快比單機快 3 倍(Studio 新聞稿)。接頭代號決定誰能加入:M6 是 Thunderbolt 4,進不了 TB5 叢集;M5 Pro mini 與 Studio 都是 TB5。

https://ithelp.ithome.com.tw/upload/images/20260909/20178110r61Vl0OZtA.jpg

來源:Apple Mac mini 2026 新聞稿.

https://ithelp.ithome.com.tw/upload/images/20260909/20178110N1CK7aDWch.jpg

來源:Apple Mac Studio 2026 新聞稿.

https://ithelp.ithome.com.tw/upload/images/20260909/20178110QyJqkZ33ep.jpg

來源:Apple Mac Studio 2026 新聞稿.

官方同時給了一組 LM Studio prompt 處理的倍數(與前代同型號比較,全部為預告數據,Apple 新聞稿):

  • M6:比 M1 快 13.5 倍、比 M4 快 4.8 倍
  • M5 Pro:比 M2 Pro 快 8.5 倍、比 M4 Pro 快 4 倍
  • M5 Max:比 M1 Max 快 10.7 倍
  • M5 Ultra:比 M1 Ultra 快 9.8 倍

注意這些是 prompt 首 token(prefill)速度,不是生成速度;生成速度仍由記憶體頻寬主導。

https://ithelp.ithome.com.tw/upload/images/20260909/20178110pjyIf6M4wW.jpg

來源:Apple Mac Studio 2026 新聞稿。圖內速度為 Apple 預告的數據,與上文「全部為預告數據」的備註一致。

四、停售世代:二手市場的規格對照

世代(發布) 晶片 頻寬 RAM 上限
Mac mini 2020-11 M1 68.25 GB/s 16 GB
Mac mini 2023-01 M2 100 GB/s 24 GB
Mac mini 2023-01 M2 Pro 200 GB/s 32 GB
Mac mini 2024-10 M4 120 GB/s 32 GB
Mac mini 2024-10 M4 Pro 273 GB/s 64 GB
Mac Studio 2022-03 M1 Max 400 GB/s 64 GB
Mac Studio 2022-03 M1 Ultra 800 GB/s 128 GB
Mac Studio 2023-06 M2 Max 400 GB/s 96 GB
Mac Studio 2023-06 M2 Ultra 800 GB/s 192 GB
Mac Studio 2025-03 M4 Max 410–546 GB/s 128 GB
Mac Studio 2025-03 M3 Ultra 800 GB/s 512 GB

(數據出處:Wikipedia Apple M12022 Studio 新聞稿2023 mini 新聞稿2023 Studio 新聞稿2024 mini 新聞稿2025 Studio 新聞稿M6/M5 Ultra 晶片新聞稿。)

注意 2025 代的 M4 Max(最高 546 GB/s)頻寬比 2023 代的 M2 Ultra(800 GB/s)低,速度也確實較慢:同一顆 8B,M4 Max 128 GB 實測 83.9 tok/s,M3 Ultra 是 95.8 tok/s。買二手時,同代內頻寬比 RAM 更影響速度;跨代時 M4 Max 對 M2 Ultra 是「新而慢」的取捨。表內 410–546 GB/s 區間取自 Apple Mac Studio(2025)官方規格頁:14 核 M4 Max 為 410 GB/s,16 核為 546 GB/s。

五、RAM 檔位對 2026 模型

前一篇的方法:權重加 KV 的總需求,壓在總記憶體的 75% 以內,才留得出 OS 與其他 app 的空間。下表把現行兩條線的每個 RAM 檔位對到 2026 現行模型(75% 線=總記憶體 × 0.75 向下取整)。

機型 總記憶體 75% 線 對 2026 模型
M6 mini 16 GB 12 GB 放得下 9B Q4(約 6 GB 加小 context),再大就吃緊
M6 mini 24 GB 18 GB 27B Q4(檔約 16.5 GB)加短 context 壓線,邊界配置
M6 mini 32 GB 24 GB 27B Q4 加中長 context 的甜點檔
M5 Pro mini 24/48/64 GB 18/36/48 GB 48 GB 起 27B 舒適,64 GB 放得下 70B 級 Q4(約 42 GB)
M5 Max Studio 64/128 GB 48/96 GB 128 GB 放得下 70B Q4 加長 context,或 106B 級 MoE 的 Q4(約 60 GB)
M5 Ultra Studio 96/256/512 GB 72/192/384 GB 96 GB 放得下 70B 級 Q4(約 42 GB)加較長 context;512 GB 是唯一放得下 753B 級 Q4(約 466 GB 加 KV)的檔;256 GB 只能降到 Q2(LLMCheck 收錄M5 Ultra 256 GB 跑 GLM-5.3 Q2 估算 29 tok/s)

兩類模型的對應邏輯不同:

  • MoE 看總參數,不看激活參數。 GLM-5.x 753B-A40B 的 Q4 檔約 466 GB,要 512 GB 才裝得下(看總參數,官方 repo 標 744B-A40B、HF 卡標 753B),但每次只激活 40B,跑起來速度接近一顆 40B 模型(看激活參數,M3 Ultra 實測 15 tok/s)。買 512 GB 換到的就是「裝得下最大檔、速度又不崩」。
  • 27B 級以下別上 Studio。 27B Q4 在 48 GB 就舒適,為它上 256 GB 沒有意義。

實例走一遍:想跑 Qwen3.8-27B、以日常對話為主、可接受 8–15 tok/s。Q4 權重 16.5 GB 加短 KV 約 18–20 GB,壓在 75% 線(32 GB 檔=24 GB)內。M6 mini 跑 27B Q4 的估算值約 8 tok/s(LLMCheck 收錄,交貨前所有數字皆為推算);M5 Pro 的頻寬 307 GB/s 約是 M6 的 1.8–2 倍,同模型只會更快。就這個需求,32 GB 的 M6 mini 就夠用。想跑 GLM-5.3 級(Q4 約 466 GB)才是另一回事:唯一選項是 512 GB 的 M5 Ultra,256 GB 只能降到 Q2。

六、踩坑:三則記憶體事故

以下三則來自社群實測報告的真實事故,每則對應一個選購或設定動作。

1. OOM/swap 凍結:權重塞不進 RAM。 一台 16 GB 的 Mac mini 用 Ollama 跑 Qwen 3.5 35B-A3B(MoE),Ollama 預載全部 26 GB 權重,系統凍結、430 萬次 swapout、10 分鐘 0 token;改用 llama.cpp 的 --mmap 後 17.3 tok/s、記憶體空閒 81%、零 swap(jock.pl 實測)。選購含義:RAM 不夠就換機器或降量化;引擎的載入策略(整包預載 vs mmap 按需讀取)可以決定一顆模型是「跑得動」還是「把機器拖死」。

2. KV cache 預先分配爆掉。 llama.cpp 會預先為「全部 context」分配 KV 空間:QwQ 32B 4-bit 的權重只有約 19 GB,但滿 context 預載時峰值可達約 51 GB;DeepSeek R1 4-bit 在 256 GB 的 M3 Max 和 RTX 5090 上都 OOM,只有 512 GB 的 M3 Ultra 跑得動(19.69 tok/s)。MLX 的 KV 是按需分配,同機同模型記憶體佔用小得多(Creative Strategies 實測)。設定含義:用 llama.cpp 跑長 context 時,KV 是記憶體帳單上的隱藏大戶;要嘛壓短 context、要嘛換 MLX 同款模型。

3. macOS 的 GPU 記憶體上限擋住載入。 一台 128 GiB 的機器,macOS 預設只把約 107.5 GiB 給 Metal 當 working set,模型超過就載入失敗。解法是 sudo sysctl iogpu.wired_limit_mb=114688(約 112 GiB),在 M5 Max 128 GB(macOS 27 beta)上驗證有效(antirez/ds4 PR #909);同一問題在 macOS 27 beta 上仍然存在,oMLX 的錯誤訊息會直接提示你調這個值(autohand/code-cli #558)。設定含義:選 256/512 GB 跑大模型時,載入前先檢查 Metal 上限,別把「macOS 擋下的」誤判成「模型裝不下」。

另有一則是固有特性而非 bug:prefill 慢、decode 快。 同一顆 Llama-3.1 8B,M3 Ultra 的 prefill 是 5.57 秒、NVIDIA DGX Spark 只要 1.47 秒(NVIDIA 快約 3.8 倍);但 decode 端反過來,M3 Ultra 是 0.85 秒、DGX Spark 要 2.87 秒(Mac 快約 3.4 倍)(exolabs 對測)。想要的體驗是「快速回答」用 Mac;「大批量長文一次塞進去跑」則 NVIDIA 路線值得評估。

七、決策流程

從「我想跑某顆模型」反推到「我該買哪個配置」,先定你要跑的模型、context 多長、什麼量化,算出模型加 KV 的總需求;確認壓得進 75% 線,再用第二節的頻寬表與速查表選出速度符合預期的機型;裝不下就降量化或升 RAM 檔位。

https://ithelp.ithome.com.tw/upload/images/20260909/20178110Kqz07YAY2b.png

選型決策流程:先算模型加 KV 的總需求,壓得進 75% 線再選機器;裝不下就降量化或升 RAM 檔位。

先買機再想跑什麼,往往卡在記憶體不夠,而 RAM 是買定離手的。2026-09-22 開賣前,M6 與 M5 Ultra 的所有速度數字都是推算;9/22 開賣後、10 月底 512 GB 供貨前,實測數據會陸續到位,屆時可以回查本文的推算值。


圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言