作者gigayaya (gigayaya)
看板Soft_Job
標題Fw: [閒聊] Mac mini M5 Pro Local LLM 小玩心得
時間Sun Oct 4 23:58:28 2026
※ [本文轉錄自 AI_Art 看板 #1gmdOU_V ]
作者: gigayaya (gigayaya) 看板: AI_Art
標題: [閒聊] Mac mini M5 Pro Local LLM 小玩心得
時間: Sun Oct 4 23:51:55 2026
前陣子買了新的mac mini打算來玩一下local llm, 過了一陣子有些心得想來分享一下
---
配備:
Mac mini
M5 Pro
48GB
512g storage
官網售價約8萬
---
買的時候發現apple刀法切的超精準,每次都感覺只要在小捏一下就可以再往上
原本只想要買丐板M6,但做了一些功課之後覺得要跑llm還是需要pro chip
結果最後捏到M5 pro + 48gb(殘血pro),用下來覺得這是目前mac mini最好的甜蜜點
---
雖然會看這個版的大概也都知道這些事情,不過我還是講解一下local llm如何工作
llm的運作可以粗略分為兩件事情:讀(prefill),寫(decode)
讀:
指的是model要把你輸入的所有文字,轉換為model運算的基本單位token以及計算KV
這個動作基本上是運算密集任務,所以跟你的GPU有關,GPU數量以及能力都會大幅影響
然後從M4到M5, apple有對GPU做一個架構上的大改進,所以M4 GPU比M5 GPU是懶覺比雞腿
然後M6比M5好像又更強一些
簡單幾個挑選方式:
1. M6 > M5 >>>> M4 and之前
2. GPU數量 多 > 少
所以雖然以單核GPU來說M6快於M5,但是GPU數量M5pro=16 > M6=12, 所以我選M5pro
寫:
指的是model每次計算出下一個token的速度,通常用每秒幾個token表示 token/second
這個任務非常重要,因為速度如果很慢,就代表model完成一件任務的速度越慢
你可以把雲端API的方式當作150 t/s來當作比較基準
這個任務的速度幾乎只跟一個數字有關:記憶體頻寬
而apple M chip的記憶體頻寬跟chip版本高度相關: Ultra > Max > Pro > 數字
幾乎每個版本往上一階,記憶體頻寬都翻倍,t/s也幾乎直接差一倍
例如:
同世代記憶體頻寬: M5 = 150 GB/s, M5 pro = 300 GB/s
如果M5的t/s=30, 那幾乎可以代表M5 pro t/s=60
然後Max又是Pro的兩倍, Ultra又是Max的兩倍 所以Max t/s=120, Ultra=240 t/s
當然這是理論值,但是實際上損失大概只在10%左右,所以這個數字還是非常重要
而M5 pro 307 GB/s >> M6 170 GB/s 這數字也是懶覺比雞腿
最後還有一個影響local llm的數字:記憶體大小
簡單來說,記憶體大小限制了你可以放進去的模型,模型其實蠻大的所以這個數字很重要
現在的開放模型我粗略地分成三種: 小(5G)、中(20G)、大(100G)
Mac mini能用的M5 pro和M6最高都只能買到64G,所以大的模型直接不用想了
那中模型大概只會佔20G記憶體,那應該買多少呢?
M5 pro: 24, 48, 64
M6: 16, 32, 64
考慮到OS本身以及你應該還會開一些基本程式,基本上就是48 vs 32的選擇
但是還有一個變數要考慮:模型的context window長度
基本上你可以想像這個數字的意思是你要給模型的"記憶體"多大,context越大你越不用
頻繁地壓縮你的聊天(每次壓縮都蠻花時間的),另外context太小可能會連一些任務都
沒辦法執行(因為模型根本連任務全部的文字都無法載入)
另外如果你的context超過你的記憶體容量而起動swap的話那速度就會崩潰式的下降,所
以要根據具體的記憶體大小設置適合的context window size
我沒實際用過但是我看很多人測中模型在32GB記憶體上會非常緊湊,因為這台電腦我不是
只拿來用跑local llm也是我平時主力使用的電腦所以我想要有更多冗餘, 所以48G最好
---
經過以上比較之後,我最後選M5 Pro 48G 我覺得這是最好的甜蜜點
當然上面我說的每個項目都有更好的選項可以選,但就是要花錢(而且還很貴)...
我要是不缺錢我也是直接買頂規Ultra XD
---
再來是跑起來
我主要是用LM Studio,Model都選MLX版本不用GGUF
基本上中模型最強的應該就是Qwen3.8 27B,也是目前open model最主流的選擇
第二個比較常看到的是Qwen3.6 35B A3B
大致上來說可以想成是:3.8跑比較慢但是比較聰明、3.6跑比較快但比較笨
原生的3.8 27B我記得大概跑出來的數字在20~30 t/s(no MTP),其實只能算勉強能用很慢
但是最近有一個新公司推出Splash版本,基本上可以理解為專門為一個模型做最佳化
我用了一下之後的確速度差很多
with M5 Pro 48G (context window size=262k) in coding task
Qwen3.8 27B splash: 50 t/s
Qwen3.6 35B A3B splash: 150 t/s
這個速度基本上算是可以用了,尤其150t/s有時候感覺噴的速度比雲端API還快
其他模型我只測了Gemma和gpt-oss
Gemma4 26B A4b的智力程度大概是Qwen3.8跟Qwen3.6之間,但是速度慢很多(30t/s?)
gpt-oss-20b跟gemma4比起來好像遜色一點,速度也比較慢
所以綜合比較下來,我最後只留Qwen兩個模型來使用
那Qwen3.8 27B大概智力程度到哪裡呢?我體感大概在opus 4.5~4.6之間
雖然寫基本的邏輯感覺沒問題,但是在規劃以及呼叫工具上感覺還是笨笨的
做一些基本小事情應該ok,但是如果要正經的做大型正式產品,我覺得還是不行
至於Qwen3.6我覺得又更笨了,唯一的優點似乎只剩速度很快,可能只有在做不重要的事
情的時候才會用它(例如噴垃圾話)
---
最後,搞了這麼多,我的心得是:2026的現在,基本上雲端AI還是屌打local llm
除非你真的有非常強的限制,資料無論如何都不能離開你的電腦,不然我覺得完全沒有
理由使用local llm當作你主要使用的模型
雖然local llm的一個好處是token不用錢,但是如果你把智力程度因素考慮進去:
雲端: 要錢, 用100個token可以完成任務
local: 不用錢, 但是要用1000個token才能完成任務
並且帶出另外一個隱性成本: 時間,假設你用雲端AI只要30分鐘就能完成的任務,local
卻要300分鐘才能完成
那我覺得相比之下local llm完全沒有性價比可言
或許我遇到的這些問題如果用到M5 Ultra(更快的速度)以及更大的模型(更高的智力)
就會自動解決,但是這個成本都要好幾十萬去了...相比起來雲端每個月只要100鎂真的是
非常划算
原本還有一個似乎不錯的應用場景是個人助理(龍蝦),但是隨著grok bot, Muse, Dots等
雲端個人助理的出現,我覺得完全沒有理由自己去建立local助理了,除非你擔心隱私問
題(again)
所以說到最後,我覺得只有極少數有非常嚴重的隱私條件下你才需要考慮local llm
否則應該99%的一般人,花個20,100鎂訂閱就是最好的甜蜜點了
不過我必須承認我主要的任務都是拿來coding,或許文生圖、圖生影,這兩個領域比起雲
端用local llm有特別的優勢
或是如果再讓中國的open model繼續跑一年,假設明年open model有opus5的程度,那
整個故事有可能就完全不一樣了
這邊分享一個影片,他比較了全部從M1到M6的所有chip跑local llm的比較
我覺得他列出來的數字跟我的感覺蠻相似的,有同樣需求的話可以參考看看:
https://www.youtube.com/watch?v=6C3_4-77vKM
--
1F:噓 mmmmO:靠 害我嚇到想說啥時有po文07/26 01:40
2F:→ mmmmmO:嫩 我比你長一點07/26 01:42
3F:→ Ommmmm:靠北喔07/26 01:43
4F:→ mmmmmO:6907/26 01:51
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 1.163.112.54 (臺灣)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/AI_Art/M.1791129118.A.FDF.html
※ 編輯: gigayaya (1.163.112.54 臺灣), 10/04/2026 23:54:10
※ 發信站: 批踢踢實業坊(ptt.cc)
※ 轉錄者: gigayaya (1.163.112.54 臺灣), 10/04/2026 23:58:28
5F:推 longlyeagle: Nice 10/05 01:05
6F:推 sarstw: 推推 10/05 01:42
7F:推 NTHUlagka: 推 10/05 05:52
8F:推 jobintan: 本地端有個最大的優勢,就是無審查,這大家都懂的。 10/05 10:59
9F:→ MOONY135: 其實你要用gemma那訂閱ollama一個月20鎂,換算Mac mini 10/05 18:08
10F:→ MOONY135: 16G的價格來說可以隨便訂很多很多年了 10/05 18:08
11F:→ MOONY135: 最近試了一個爬價功能 當初用Hermes+gemma4 28B很多地方 10/05 18:11
12F:→ MOONY135: 調整了一下 大概最終花了三天才穩定。最近的gemini大概2 10/05 18:11
13F:→ MOONY135: 0分鐘就弄出來了。local的爬蟲真的有很多問題要突破,不 10/05 18:11
14F:→ MOONY135: 過也可能是我比較龜毛 我把野馬關在docker裡面不讓他直 10/05 18:11
15F:→ MOONY135: 接碰我的電腦 10/05 18:11
16F:推 FreedomTrail: 關起來真的比較安全 10/05 18:55
17F:推 jhjhs33504: 只要模型沒對齊就不可能有穩定的一天自然就需要關起來 10/05 23:18