Soft_Job 板


LINE

※ [本文转录自 AI_Art 看板 #1gmdOU_V ] 作者: gigayaya (gigayaya) 看板: AI_Art 标题: [闲聊] Mac mini M5 Pro Local LLM 小玩心得 时间: Sun Oct 4 23:51:55 2026 前阵子买了新的mac mini打算来玩一下local llm, 过了一阵子有些心得想来分享一下 --- 配备: Mac mini M5 Pro 48GB 512g storage 官网售价约8万 --- 买的时候发现apple刀法切的超精准,每次都感觉只要在小捏一下就可以再往上 原本只想要买丐板M6,但做了一些功课之後觉得要跑llm还是需要pro chip 结果最後捏到M5 pro + 48gb(残血pro),用下来觉得这是目前mac mini最好的甜蜜点 --- 虽然会看这个版的大概也都知道这些事情,不过我还是讲解一下local llm如何工作 llm的运作可以粗略分为两件事情:读(prefill),写(decode) 读: 指的是model要把你输入的所有文字,转换为model运算的基本单位token以及计算KV 这个动作基本上是运算密集任务,所以跟你的GPU有关,GPU数量以及能力都会大幅影响 然後从M4到M5, apple有对GPU做一个架构上的大改进,所以M4 GPU比M5 GPU是懒觉比鸡腿 然後M6比M5好像又更强一些 简单几个挑选方式: 1. M6 > M5 >>>> M4 and之前 2. GPU数量 多 > 少 所以虽然以单核GPU来说M6快於M5,但是GPU数量M5pro=16 > M6=12, 所以我选M5pro 写: 指的是model每次计算出下一个token的速度,通常用每秒几个token表示 token/second 这个任务非常重要,因为速度如果很慢,就代表model完成一件任务的速度越慢 你可以把云端API的方式当作150 t/s来当作比较基准 这个任务的速度几乎只跟一个数字有关:记忆体频宽 而apple M chip的记忆体频宽跟chip版本高度相关: Ultra > Max > Pro > 数字 几乎每个版本往上一阶,记忆体频宽都翻倍,t/s也几乎直接差一倍 例如: 同世代记忆体频宽: M5 = 150 GB/s, M5 pro = 300 GB/s 如果M5的t/s=30, 那几乎可以代表M5 pro t/s=60 然後Max又是Pro的两倍, Ultra又是Max的两倍 所以Max t/s=120, Ultra=240 t/s 当然这是理论值,但是实际上损失大概只在10%左右,所以这个数字还是非常重要 而M5 pro 307 GB/s >> M6 170 GB/s 这数字也是懒觉比鸡腿 最後还有一个影响local llm的数字:记忆体大小 简单来说,记忆体大小限制了你可以放进去的模型,模型其实蛮大的所以这个数字很重要 现在的开放模型我粗略地分成三种: 小(5G)、中(20G)、大(100G) Mac mini能用的M5 pro和M6最高都只能买到64G,所以大的模型直接不用想了 那中模型大概只会占20G记忆体,那应该买多少呢? M5 pro: 24, 48, 64 M6: 16, 32, 64 考虑到OS本身以及你应该还会开一些基本程式,基本上就是48 vs 32的选择 但是还有一个变数要考虑:模型的context window长度 基本上你可以想像这个数字的意思是你要给模型的"记忆体"多大,context越大你越不用 频繁地压缩你的聊天(每次压缩都蛮花时间的),另外context太小可能会连一些任务都 没办法执行(因为模型根本连任务全部的文字都无法载入) 另外如果你的context超过你的记忆体容量而起动swap的话那速度就会崩溃式的下降,所 以要根据具体的记忆体大小设置适合的context window size 我没实际用过但是我看很多人测中模型在32GB记忆体上会非常紧凑,因为这台电脑我不是 只拿来用跑local llm也是我平时主力使用的电脑所以我想要有更多冗余, 所以48G最好 --- 经过以上比较之後,我最後选M5 Pro 48G 我觉得这是最好的甜蜜点 当然上面我说的每个项目都有更好的选项可以选,但就是要花钱(而且还很贵)... 我要是不缺钱我也是直接买顶规Ultra XD --- 再来是跑起来 我主要是用LM Studio,Model都选MLX版本不用GGUF 基本上中模型最强的应该就是Qwen3.8 27B,也是目前open model最主流的选择 第二个比较常看到的是Qwen3.6 35B A3B 大致上来说可以想成是:3.8跑比较慢但是比较聪明、3.6跑比较快但比较笨 原生的3.8 27B我记得大概跑出来的数字在20~30 t/s(no MTP),其实只能算勉强能用很慢 但是最近有一个新公司推出Splash版本,基本上可以理解为专门为一个模型做最佳化 我用了一下之後的确速度差很多 with M5 Pro 48G (context window size=262k) in coding task Qwen3.8 27B splash: 50 t/s Qwen3.6 35B A3B splash: 150 t/s 这个速度基本上算是可以用了,尤其150t/s有时候感觉喷的速度比云端API还快 其他模型我只测了Gemma和gpt-oss Gemma4 26B A4b的智力程度大概是Qwen3.8跟Qwen3.6之间,但是速度慢很多(30t/s?) gpt-oss-20b跟gemma4比起来好像逊色一点,速度也比较慢 所以综合比较下来,我最後只留Qwen两个模型来使用 那Qwen3.8 27B大概智力程度到哪里呢?我体感大概在opus 4.5~4.6之间 虽然写基本的逻辑感觉没问题,但是在规划以及呼叫工具上感觉还是笨笨的 做一些基本小事情应该ok,但是如果要正经的做大型正式产品,我觉得还是不行 至於Qwen3.6我觉得又更笨了,唯一的优点似乎只剩速度很快,可能只有在做不重要的事 情的时候才会用它(例如喷垃圾话) --- 最後,搞了这麽多,我的心得是:2026的现在,基本上云端AI还是屌打local llm 除非你真的有非常强的限制,资料无论如何都不能离开你的电脑,不然我觉得完全没有 理由使用local llm当作你主要使用的模型 虽然local llm的一个好处是token不用钱,但是如果你把智力程度因素考虑进去: 云端: 要钱, 用100个token可以完成任务 local: 不用钱, 但是要用1000个token才能完成任务 并且带出另外一个隐性成本: 时间,假设你用云端AI只要30分钟就能完成的任务,local 却要300分钟才能完成 那我觉得相比之下local llm完全没有性价比可言 或许我遇到的这些问题如果用到M5 Ultra(更快的速度)以及更大的模型(更高的智力) 就会自动解决,但是这个成本都要好几十万去了...相比起来云端每个月只要100镁真的是 非常划算 原本还有一个似乎不错的应用场景是个人助理(龙虾),但是随着grok bot, Muse, Dots等 云端个人助理的出现,我觉得完全没有理由自己去建立local助理了,除非你担心隐私问 题(again) 所以说到最後,我觉得只有极少数有非常严重的隐私条件下你才需要考虑local llm 否则应该99%的一般人,花个20,100镁订阅就是最好的甜蜜点了 不过我必须承认我主要的任务都是拿来coding,或许文生图、图生影,这两个领域比起云 端用local llm有特别的优势 或是如果再让中国的open model继续跑一年,假设明年open model有opus5的程度,那 整个故事有可能就完全不一样了 这边分享一个影片,他比较了全部从M1到M6的所有chip跑local llm的比较 我觉得他列出来的数字跟我的感觉蛮相似的,有同样需求的话可以参考看看: https://www.youtube.com/watch?v=6C3_4-77vKM
--
1F:嘘 mmmmO:靠 害我吓到想说啥时有po文07/26 01:40
2F:→ mmmmmO:嫩 我比你长一点07/26 01:42
3F:→ Ommmmm:靠北喔07/26 01:43
4F:→ mmmmmO:6907/26 01:51
--



※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 1.163.112.54 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/AI_Art/M.1791129118.A.FDF.html ※ 编辑: gigayaya (1.163.112.54 台湾), 10/04/2026 23:54:10



※ 发信站: 批踢踢实业坊(ptt.cc)
※ 转录者: gigayaya (1.163.112.54 台湾), 10/04/2026 23:58:28
5F:推 longlyeagle: Nice 10/05 01:05
6F:推 sarstw: 推推 10/05 01:42
7F:推 NTHUlagka: 推 10/05 05:52
8F:推 jobintan: 本地端有个最大的优势,就是无审查,这大家都懂的。 10/05 10:59
9F:→ MOONY135: 其实你要用gemma那订阅ollama一个月20镁,换算Mac mini 10/05 18:08
10F:→ MOONY135: 16G的价格来说可以随便订很多很多年了 10/05 18:08
11F:→ MOONY135: 最近试了一个爬价功能 当初用Hermes+gemma4 28B很多地方 10/05 18:11
12F:→ MOONY135: 调整了一下 大概最终花了三天才稳定。最近的gemini大概2 10/05 18:11
13F:→ MOONY135: 0分钟就弄出来了。local的爬虫真的有很多问题要突破,不 10/05 18:11
14F:→ MOONY135: 过也可能是我比较龟毛 我把野马关在docker里面不让他直 10/05 18:11
15F:→ MOONY135: 接碰我的电脑 10/05 18:11
16F:推 FreedomTrail: 关起来真的比较安全 10/05 18:55
17F:推 jhjhs33504: 只要模型没对齐就不可能有稳定的一天自然就需要关起来 10/05 23:18







like.gif 您可能会有兴趣的文章
icon.png[问题/行为] 猫晚上进房间会不会有憋尿问题
icon.pngRe: [闲聊] 选了错误的女孩成为魔法少女 XDDDDDDDDDD
icon.png[正妹] 瑞典 一张
icon.png[心得] EMS高领长版毛衣.墨小楼MC1002
icon.png[分享] 丹龙隔热纸GE55+33+22
icon.png[问题] 清洗洗衣机
icon.png[寻物] 窗台下的空间
icon.png[闲聊] 双极の女神1 木魔爵
icon.png[售车] 新竹 1997 march 1297cc 白色 四门
icon.png[讨论] 能从照片感受到摄影者心情吗
icon.png[狂贺] 贺贺贺贺 贺!岛村卯月!总选举NO.1
icon.png[难过] 羡慕白皮肤的女生
icon.png阅读文章
icon.png[黑特]
icon.png[问题] SBK S1安装於安全帽位置
icon.png[分享] 旧woo100绝版开箱!!
icon.pngRe: [无言] 关於小包卫生纸
icon.png[开箱] E5-2683V3 RX480Strix 快睿C1 简单测试
icon.png[心得] 苍の海贼龙 地狱 执行者16PT
icon.png[售车] 1999年Virage iO 1.8EXi
icon.png[心得] 挑战33 LV10 狮子座pt solo
icon.png[闲聊] 手把手教你不被桶之新手主购教学
icon.png[分享] Civic Type R 量产版官方照无预警流出
icon.png[售车] Golf 4 2.0 银色 自排
icon.png[出售] Graco提篮汽座(有底座)2000元诚可议
icon.png[问题] 请问补牙材质掉了还能再补吗?(台中半年内
icon.png[问题] 44th 单曲 生写竟然都给重复的啊啊!
icon.png[心得] 华南红卡/icash 核卡
icon.png[问题] 拔牙矫正这样正常吗
icon.png[赠送] 老莫高业 初业 102年版
icon.png[情报] 三大行动支付 本季掀战火
icon.png[宝宝] 博客来Amos水蜡笔5/1特价五折
icon.pngRe: [心得] 新鲜人一些面试分享
icon.png[心得] 苍の海贼龙 地狱 麒麟25PT
icon.pngRe: [闲聊] (君の名は。雷慎入) 君名二创漫画翻译
icon.pngRe: [闲聊] OGN中场影片:失踪人口局 (英文字幕)
icon.png[问题] 台湾大哥大4G讯号差
icon.png[出售] [全国]全新千寻侘草LED灯, 水草

请输入看板名称,例如:WOW 或 站内搜寻

TOP