作者gigayaya (gigayaya)
看板Soft_Job
标题Fw: [闲聊] Mac mini M5 Pro Local LLM 小玩心得
时间Sun Oct 4 23:58:28 2026
※ [本文转录自 AI_Art 看板 #1gmdOU_V ]
作者: gigayaya (gigayaya) 看板: AI_Art
标题: [闲聊] Mac mini M5 Pro Local LLM 小玩心得
时间: Sun Oct 4 23:51:55 2026
前阵子买了新的mac mini打算来玩一下local llm, 过了一阵子有些心得想来分享一下
---
配备:
Mac mini
M5 Pro
48GB
512g storage
官网售价约8万
---
买的时候发现apple刀法切的超精准,每次都感觉只要在小捏一下就可以再往上
原本只想要买丐板M6,但做了一些功课之後觉得要跑llm还是需要pro chip
结果最後捏到M5 pro + 48gb(残血pro),用下来觉得这是目前mac mini最好的甜蜜点
---
虽然会看这个版的大概也都知道这些事情,不过我还是讲解一下local llm如何工作
llm的运作可以粗略分为两件事情:读(prefill),写(decode)
读:
指的是model要把你输入的所有文字,转换为model运算的基本单位token以及计算KV
这个动作基本上是运算密集任务,所以跟你的GPU有关,GPU数量以及能力都会大幅影响
然後从M4到M5, apple有对GPU做一个架构上的大改进,所以M4 GPU比M5 GPU是懒觉比鸡腿
然後M6比M5好像又更强一些
简单几个挑选方式:
1. M6 > M5 >>>> M4 and之前
2. GPU数量 多 > 少
所以虽然以单核GPU来说M6快於M5,但是GPU数量M5pro=16 > M6=12, 所以我选M5pro
写:
指的是model每次计算出下一个token的速度,通常用每秒几个token表示 token/second
这个任务非常重要,因为速度如果很慢,就代表model完成一件任务的速度越慢
你可以把云端API的方式当作150 t/s来当作比较基准
这个任务的速度几乎只跟一个数字有关:记忆体频宽
而apple M chip的记忆体频宽跟chip版本高度相关: Ultra > Max > Pro > 数字
几乎每个版本往上一阶,记忆体频宽都翻倍,t/s也几乎直接差一倍
例如:
同世代记忆体频宽: M5 = 150 GB/s, M5 pro = 300 GB/s
如果M5的t/s=30, 那几乎可以代表M5 pro t/s=60
然後Max又是Pro的两倍, Ultra又是Max的两倍 所以Max t/s=120, Ultra=240 t/s
当然这是理论值,但是实际上损失大概只在10%左右,所以这个数字还是非常重要
而M5 pro 307 GB/s >> M6 170 GB/s 这数字也是懒觉比鸡腿
最後还有一个影响local llm的数字:记忆体大小
简单来说,记忆体大小限制了你可以放进去的模型,模型其实蛮大的所以这个数字很重要
现在的开放模型我粗略地分成三种: 小(5G)、中(20G)、大(100G)
Mac mini能用的M5 pro和M6最高都只能买到64G,所以大的模型直接不用想了
那中模型大概只会占20G记忆体,那应该买多少呢?
M5 pro: 24, 48, 64
M6: 16, 32, 64
考虑到OS本身以及你应该还会开一些基本程式,基本上就是48 vs 32的选择
但是还有一个变数要考虑:模型的context window长度
基本上你可以想像这个数字的意思是你要给模型的"记忆体"多大,context越大你越不用
频繁地压缩你的聊天(每次压缩都蛮花时间的),另外context太小可能会连一些任务都
没办法执行(因为模型根本连任务全部的文字都无法载入)
另外如果你的context超过你的记忆体容量而起动swap的话那速度就会崩溃式的下降,所
以要根据具体的记忆体大小设置适合的context window size
我没实际用过但是我看很多人测中模型在32GB记忆体上会非常紧凑,因为这台电脑我不是
只拿来用跑local llm也是我平时主力使用的电脑所以我想要有更多冗余, 所以48G最好
---
经过以上比较之後,我最後选M5 Pro 48G 我觉得这是最好的甜蜜点
当然上面我说的每个项目都有更好的选项可以选,但就是要花钱(而且还很贵)...
我要是不缺钱我也是直接买顶规Ultra XD
---
再来是跑起来
我主要是用LM Studio,Model都选MLX版本不用GGUF
基本上中模型最强的应该就是Qwen3.8 27B,也是目前open model最主流的选择
第二个比较常看到的是Qwen3.6 35B A3B
大致上来说可以想成是:3.8跑比较慢但是比较聪明、3.6跑比较快但比较笨
原生的3.8 27B我记得大概跑出来的数字在20~30 t/s(no MTP),其实只能算勉强能用很慢
但是最近有一个新公司推出Splash版本,基本上可以理解为专门为一个模型做最佳化
我用了一下之後的确速度差很多
with M5 Pro 48G (context window size=262k) in coding task
Qwen3.8 27B splash: 50 t/s
Qwen3.6 35B A3B splash: 150 t/s
这个速度基本上算是可以用了,尤其150t/s有时候感觉喷的速度比云端API还快
其他模型我只测了Gemma和gpt-oss
Gemma4 26B A4b的智力程度大概是Qwen3.8跟Qwen3.6之间,但是速度慢很多(30t/s?)
gpt-oss-20b跟gemma4比起来好像逊色一点,速度也比较慢
所以综合比较下来,我最後只留Qwen两个模型来使用
那Qwen3.8 27B大概智力程度到哪里呢?我体感大概在opus 4.5~4.6之间
虽然写基本的逻辑感觉没问题,但是在规划以及呼叫工具上感觉还是笨笨的
做一些基本小事情应该ok,但是如果要正经的做大型正式产品,我觉得还是不行
至於Qwen3.6我觉得又更笨了,唯一的优点似乎只剩速度很快,可能只有在做不重要的事
情的时候才会用它(例如喷垃圾话)
---
最後,搞了这麽多,我的心得是:2026的现在,基本上云端AI还是屌打local llm
除非你真的有非常强的限制,资料无论如何都不能离开你的电脑,不然我觉得完全没有
理由使用local llm当作你主要使用的模型
虽然local llm的一个好处是token不用钱,但是如果你把智力程度因素考虑进去:
云端: 要钱, 用100个token可以完成任务
local: 不用钱, 但是要用1000个token才能完成任务
并且带出另外一个隐性成本: 时间,假设你用云端AI只要30分钟就能完成的任务,local
却要300分钟才能完成
那我觉得相比之下local llm完全没有性价比可言
或许我遇到的这些问题如果用到M5 Ultra(更快的速度)以及更大的模型(更高的智力)
就会自动解决,但是这个成本都要好几十万去了...相比起来云端每个月只要100镁真的是
非常划算
原本还有一个似乎不错的应用场景是个人助理(龙虾),但是随着grok bot, Muse, Dots等
云端个人助理的出现,我觉得完全没有理由自己去建立local助理了,除非你担心隐私问
题(again)
所以说到最後,我觉得只有极少数有非常严重的隐私条件下你才需要考虑local llm
否则应该99%的一般人,花个20,100镁订阅就是最好的甜蜜点了
不过我必须承认我主要的任务都是拿来coding,或许文生图、图生影,这两个领域比起云
端用local llm有特别的优势
或是如果再让中国的open model继续跑一年,假设明年open model有opus5的程度,那
整个故事有可能就完全不一样了
这边分享一个影片,他比较了全部从M1到M6的所有chip跑local llm的比较
我觉得他列出来的数字跟我的感觉蛮相似的,有同样需求的话可以参考看看:
https://www.youtube.com/watch?v=6C3_4-77vKM
--
1F:嘘 mmmmO:靠 害我吓到想说啥时有po文07/26 01:40
2F:→ mmmmmO:嫩 我比你长一点07/26 01:42
3F:→ Ommmmm:靠北喔07/26 01:43
4F:→ mmmmmO:6907/26 01:51
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 1.163.112.54 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/AI_Art/M.1791129118.A.FDF.html
※ 编辑: gigayaya (1.163.112.54 台湾), 10/04/2026 23:54:10
※ 发信站: 批踢踢实业坊(ptt.cc)
※ 转录者: gigayaya (1.163.112.54 台湾), 10/04/2026 23:58:28
5F:推 longlyeagle: Nice 10/05 01:05
6F:推 sarstw: 推推 10/05 01:42
7F:推 NTHUlagka: 推 10/05 05:52
8F:推 jobintan: 本地端有个最大的优势,就是无审查,这大家都懂的。 10/05 10:59
9F:→ MOONY135: 其实你要用gemma那订阅ollama一个月20镁,换算Mac mini 10/05 18:08
10F:→ MOONY135: 16G的价格来说可以随便订很多很多年了 10/05 18:08
11F:→ MOONY135: 最近试了一个爬价功能 当初用Hermes+gemma4 28B很多地方 10/05 18:11
12F:→ MOONY135: 调整了一下 大概最终花了三天才稳定。最近的gemini大概2 10/05 18:11
13F:→ MOONY135: 0分钟就弄出来了。local的爬虫真的有很多问题要突破,不 10/05 18:11
14F:→ MOONY135: 过也可能是我比较龟毛 我把野马关在docker里面不让他直 10/05 18:11
15F:→ MOONY135: 接碰我的电脑 10/05 18:11
16F:推 FreedomTrail: 关起来真的比较安全 10/05 18:55
17F:推 jhjhs33504: 只要模型没对齐就不可能有稳定的一天自然就需要关起来 10/05 23:18