作者gigayaya (gigayaya)
看板AI_Art
標題[閒聊] Mac mini M5 Pro Local LLM 小玩心得
時間Sun Oct 4 23:51:55 2026
前陣子買了新的mac mini打算來玩一下local llm, 過了一陣子有些心得想來分享一下
---
配備:
Mac mini
M5 Pro
48GB
512g storage
官網售價約8萬
---
買的時候發現apple刀法切的超精準,每次都感覺只要在小捏一下就可以再往上
原本只想要買丐板M6,但做了一些功課之後覺得要跑llm還是需要pro chip
結果最後捏到M5 pro + 48gb(殘血pro),用下來覺得這是目前mac mini最好的甜蜜點
---
雖然會看這個版的大概也都知道這些事情,不過我還是講解一下local llm如何工作
llm的運作可以粗略分為兩件事情:讀(prefill),寫(decode)
讀:
指的是model要把你輸入的所有文字,轉換為model運算的基本單位token以及計算KV
這個動作基本上是運算密集任務,所以跟你的GPU有關,GPU數量以及能力都會大幅影響
然後從M4到M5, apple有對GPU做一個架構上的大改進,所以M4 GPU比M5 GPU是懶覺比雞腿
然後M6比M5好像又更強一些
簡單幾個挑選方式:
1. M6 > M5 >>>> M4 and之前
2. GPU數量 多 > 少
所以雖然以單核GPU來說M6快於M5,但是GPU數量M5pro=16 > M6=12, 所以我選M5pro
寫:
指的是model每次計算出下一個token的速度,通常用每秒幾個token表示 token/second
這個任務非常重要,因為速度如果很慢,就代表model完成一件任務的速度越慢
你可以把雲端API的方式當作150 t/s來當作比較基準
這個任務的速度幾乎只跟一個數字有關:記憶體頻寬
而apple M chip的記憶體頻寬跟chip版本高度相關: Ultra > Max > Pro > 數字
幾乎每個版本往上一階,記憶體頻寬都翻倍,t/s也幾乎直接差一倍
例如:
同世代記憶體頻寬: M5 = 150 GB/s, M5 pro = 300 GB/s
如果M5的t/s=30, 那幾乎可以代表M5 pro t/s=60
然後Max又是Pro的兩倍, Ultra又是Max的兩倍 所以Max t/s=120, Ultra=240 t/s
當然這是理論值,但是實際上損失大概只在10%左右,所以這個數字還是非常重要
而M5 pro 307 GB/s >> M6 170 GB/s 這數字也是懶覺比雞腿
最後還有一個影響local llm的數字:記憶體大小
簡單來說,記憶體大小限制了你可以放進去的模型,模型其實蠻大的所以這個數字很重要
現在的開放模型我粗略地分成三種: 小(5G)、中(20G)、大(100G)
Mac mini能用的M5 pro和M6最高都只能買到64G,所以大的模型直接不用想了
那中模型大概只會佔20G記憶體,那應該買多少呢?
M5 pro: 24, 48, 64
M6: 16, 32, 64
考慮到OS本身以及你應該還會開一些基本程式,基本上就是48 vs 32的選擇
但是還有一個變數要考慮:模型的context window長度
基本上你可以想像這個數字的意思是你要給模型的"記憶體"多大,context越大你越不用
頻繁地壓縮你的聊天(每次壓縮都蠻花時間的),另外context太小可能會連一些任務都
沒辦法執行(因為模型根本連任務全部的文字都無法載入)
另外如果你的context超過你的記憶體容量而起動swap的話那速度就會崩潰式的下降,所
以要根據具體的記憶體大小設置適合的context window size
我沒實際用過但是我看很多人測中模型在32GB記憶體上會非常緊湊,因為這台電腦我不是
只拿來用跑local llm也是我平時主力使用的電腦所以我想要有更多冗餘, 所以48G最好
---
經過以上比較之後,我最後選M5 Pro 48G 我覺得這是最好的甜蜜點
當然上面我說的每個項目都有更好的選項可以選,但就是要花錢(而且還很貴)...
我要是不缺錢我也是直接買頂規Ultra XD
---
再來是跑起來
我主要是用LM Studio,Model都選MLX版本不用GGUF
基本上中模型最強的應該就是Qwen3.8 27B,也是目前open model最主流的選擇
第二個比較常看到的是Qwen3.6 35B A3B
大致上來說可以想成是:3.8跑比較慢但是比較聰明、3.6跑比較快但比較笨
原生的3.8 27B我記得大概跑出來的數字在20~30 t/s(no MTP),其實只能算勉強能用很慢
但是最近有一個新公司推出Splash版本,基本上可以理解為專門為一個模型做最佳化
我用了一下之後的確速度差很多
with M5 Pro 48G (context window size=262k) in coding task
Qwen3.8 27B splash: 50 t/s
Qwen3.6 35B A3B splash: 150 t/s
這個速度基本上算是可以用了,尤其150t/s有時候感覺噴的速度比雲端API還快
其他模型我只測了Gemma和gpt-oss
Gemma4 26B A4b的智力程度大概是Qwen3.8跟Qwen3.6之間,但是速度慢很多(30t/s?)
gpt-oss-20b跟gemma4比起來好像遜色一點,速度也比較慢
所以綜合比較下來,我最後只留Qwen兩個模型來使用
那Qwen3.8 27B大概智力程度到哪裡呢?我體感大概在opus 4.5~4.6之間
雖然寫基本的邏輯感覺沒問題,但是在規劃以及呼叫工具上感覺還是笨笨的
做一些基本小事情應該ok,但是如果要正經的做大型正式產品,我覺得還是不行
至於Qwen3.6我覺得又更笨了,唯一的優點似乎只剩速度很快,可能只有在做不重要的事
情的時候才會用它(例如噴垃圾話)
---
最後,搞了這麼多,我的心得是:2026的現在,基本上雲端AI還是屌打local llm
除非你真的有非常強的限制,資料無論如何都不能離開你的電腦,不然我覺得完全沒有
理由使用local llm當作你主要使用的模型
雖然local llm的一個好處是token不用錢,但是如果你把智力程度因素考慮進去:
雲端: 要錢, 用100個token可以完成任務
local: 不用錢, 但是要用1000個token才能完成任務
並且帶出另外一個隱性成本: 時間,假設你用雲端AI只要30分鐘就能完成的任務,local
卻要300分鐘才能完成
那我覺得相比之下local llm完全沒有性價比可言
或許我遇到的這些問題如果用到M5 Ultra(更快的速度)以及更大的模型(更高的智力)
就會自動解決,但是這個成本都要好幾十萬去了...相比起來雲端每個月只要100鎂真的是
非常划算
原本還有一個似乎不錯的應用場景是個人助理(龍蝦),但是隨著grok bot, Muse, Dots等
雲端個人助理的出現,我覺得完全沒有理由自己去建立local助理了,除非你擔心隱私問
題(again)
所以說到最後,我覺得只有極少數有非常嚴重的隱私條件下你才需要考慮local llm
否則應該99%的一般人,花個20,100鎂訂閱就是最好的甜蜜點了
不過我必須承認我主要的任務都是拿來coding,或許文生圖、圖生影,這兩個領域比起雲
端用local llm有特別的優勢
或是如果再讓中國的open model繼續跑一年,假設明年open model有opus5的程度,那
整個故事有可能就完全不一樣了
這邊分享一個影片,他比較了全部從M1到M6的所有chip跑local llm的比較
我覺得他列出來的數字跟我的感覺蠻相似的,有同樣需求的話可以參考看看:
https://www.youtube.com/watch?v=6C3_4-77vKM
--
1F:噓 mmmmO:靠 害我嚇到想說啥時有po文07/26 01:40
2F:→ mmmmmO:嫩 我比你長一點07/26 01:42
3F:→ Ommmmm:靠北喔07/26 01:43
4F:→ mmmmmO:6907/26 01:51
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 1.163.112.54 (臺灣)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/AI_Art/M.1791129118.A.FDF.html
※ 編輯: gigayaya (1.163.112.54 臺灣), 10/04/2026 23:54:10
5F:推 guogu: 本地AI對我來說還是太貴了 沒買過那麼貴的電腦... 10/05 01:16
6F:→ guogu: 但是之後還有可能越來越貴 真讓人頭痛 10/05 01:16
7F:推 Supasizeit: 所以我買MBA decode慢一點又不是寫扣聊天根本沒差 32 10/05 01:25
8F:→ Supasizeit: G只要五萬 還可以帶出門 10/05 01:25
9F:推 are2: 現在有strata 哪需要多好的電腦 模型還比這強 10/05 01:56
10F:→ are2: 速度還比這快 電競機變AI機 10/05 01:57
11F:推 are2: 雲端AI被延遲搞一下就知道慢 網路開銷閃不掉 10/05 02:11
12F:推 necrophagist: Strata這種針對單一模型推理的優化應該會愈來愈多 10/05 02:14
13F:→ necrophagist: 我5070ti+64g ram能跑qwen3.8-125B(Q3) 70-90tps p 10/05 02:14
14F:→ necrophagist: refill 1500 文字處理類苦工完全能丟給它做了 10/05 02:14
15F:推 stlinman: 工作流程先讓用雲端API跑通,再把敏感資料給本地跑。我 10/05 02:32
16F:→ stlinman: 覺得雲端跟本地搭配著用還是有很多用處,至少本地能破限 10/05 02:33
17F:→ ganei: 3.8 27b跑Q5以上就不會那麼笨了 10/05 03:16
18F:推 Sam27: 我本來也跑27B,但上週的strata真的太強太誇張了 10/05 04:53
19F:→ Sam27: 只能說快把ram加到128g,明年才夠用,現在期待Qwen4 10/05 04:57
20F:推 Sam27: 還是須要硬體啦,但不用到5090或Pro6000了,但50系列有優 10/05 05:00
21F:→ Sam27: 化會更強更快 10/05 05:00
22F:→ Sam27: 另外我覺得雲端會愈來愈貴,現在訂閱便宜是推廣補貼期,就 10/05 05:10
23F:→ Sam27: 跟當年Uber一樣,上市後華爾街不會同意繼續瘋狂補貼的 10/05 05:10
24F:推 YCL13: 近期的ninfer(27B)和strata(flash)真的都很驚人 10/05 06:15
25F:→ ljuber: Strata若在8gb vram跟32gb dram筆電他會推薦模型嗎? 10/05 07:05
26F:推 YCL13: strata是專為Qwen3.8 flash next開發的,看其說明下限是12G 10/05 07:13
27F:→ YCL13: VRAM+32G RAM+80G SSD,沒有的就不用想這個了 10/05 07:14
28F:推 error405: 專用加速器喔 挖靠 10/05 07:53
29F:推 lordmi: strata把大量步驟移到ram和ssd,在這兩樣都貴的時代長期 10/05 07:58
30F:→ lordmi: 成本也不低。不過macpro和395相較定位就更尷尬了 10/05 07:58
31F:→ Sam27: 27B的AA約30分,Flash next約40分,需要64~96G系統記憶體 10/05 08:27
32F:→ Sam27: 速度真的快又比27B聰明,明年的MOE參數再大的話要128G了 10/05 08:29
33F:→ Sam27: 可以把例行事項,要opus5.5寫好規則來監督幾天 10/05 08:30
34F:推 XALANX: 感謝分享,我就是屬於不知道的那邊 10/05 08:51
35F:推 Tosca: 其實我一直好奇像是台積電裡面的工程師 怎麼跑AI 10/05 09:00
36F:→ Tosca: 它們的資料感覺都不適合上傳到線上服務阿 商業機密一堆 10/05 09:00
37F:→ Tosca: 那不就也只能在本地跑?! 10/05 09:00
38F:推 Supasizeit: 你們沒聽說發哥鬼故事嗎 10/05 09:05
39F:推 newyorker54: strata只有支援到IQ3量化,算是不得已的折衷方案 10/05 09:11
40F:→ newyorker54: 我用llama.cpp跑qwen3.8 Q4K還不錯,我分不出來Deeps 10/05 09:14
41F:→ newyorker54: eek flash有沒有優於qwen flash但是DS flash速度慢很 10/05 09:14
42F:→ newyorker54: 多 10/05 09:14
43F:推 newyorker54: 本地硬體夠強還可拿來生圖生影片,生音樂,或是每個 10/05 09:21
44F:→ newyorker54: 功能各個都付API費用,兩三年下來也不少錢 10/05 09:21
45F:推 are2: 現在A卡還便宜 STRATA讓A卡本地windows方案 沒有之一 10/05 09:24
46F:推 lordmi: strata moe的專家只有6b,coding不太可能有opus等級 10/05 09:27
47F:推 newyorker54: 如果去年有置入硬體,今年應該會覺得本地模型夠用, 10/05 09:33
48F:→ newyorker54: 有256g的顯示記憶體或512g應該就不會想用雲端了,去 10/05 09:33
49F:→ newyorker54: 年買的硬體今年翻了兩三倍,明年賣說不定比買入價還 10/05 09:33
50F:→ newyorker54: 高 10/05 09:33
51F:推 Tosca: 話說48GB記憶體應該是跑不動krea2 turbo FP16吧 10/05 09:34
52F:→ Tosca: 可能要跑更小的蒸餾模型 10/05 09:34
53F:→ Tosca: 我M4 pro 64GB 跑Krea2 記憶體使用量就已經60GB了 10/05 09:35
54F:→ newyorker54: 我現在很少跑雲端,google pro 全家餐給家人用,主機 10/05 09:36
55F:→ newyorker54: 開放連線,也讓全家生圖生影片,很值得,只是家人不 10/05 09:36
56F:→ newyorker54: 知道我花了多少錢,哈哈哈 10/05 09:36
57F:→ newyorker54: 要就是256g一次到位,這幾年硬體價錢下不來 10/05 09:38
58F:推 Tosca: 256GB的mac studio要一支勞力士了QQ 10/05 09:39
59F:→ gigayaya: 查了一下Strata的確很厲害 可惜不支援mac 10/05 09:47
60F:推 Sam27: Mac是統一記憶體不須要這,Strata是讓顯卡跑MOE的速度變快 10/05 09:55
61F:→ Sam27: 2-3倍,但系統ram要夠 10/05 09:55
62F:推 guogu: A卡也沒很便宜阿 只是貴 跟 很貴的差別 10/05 09:56
63F:推 ZMTL: 越聽你們講越想把32GB兩條換成64GB兩條 +4萬吧現在 10/05 10:03
64F:推 newyorker54: 有勞力士能摸到C罩杯,有256g mac studio 只能coding 10/05 10:04
65F:→ newyorker54: C語言 10/05 10:04
66F:推 Sam27: Strata就是讓大家都不用買Pro 6000,但系統ram還是要裝滿 10/05 10:08
67F:→ Supasizeit: 以將本求利做生意來講 訂雲端+租bare metal一定是最 10/05 10:23
68F:→ Supasizeit: 划算 除非你是像我朋友要跑一億筆資料這種 10/05 10:23
69F:推 Supasizeit: Mac也是有類似的 用SSD去搞 有成功跑Qwen3.8 在iPhon 10/05 10:32
70F:→ Supasizeit: e 上 10/05 10:32
71F:推 h0103661: 直接預訂這個月的mac 5 ultra 512g吧,記憶體頻寬沒閹 10/05 11:04
72F:→ h0103661: 割了,跑ds理論能破100tps 10/05 11:04
73F:推 Tosca: 512GB那台不知道要不要一百萬=.= 10/05 11:16
74F:推 Tosca: mac pro 2019當年要19萬就覺得已經是天價了 10/05 11:21
75F:→ Tosca: 想不到現在20萬算地板XDDDD 10/05 11:21
76F:→ Sam27: 論壇和GPT有估計,同條件Q4,上下文262K跑Qwen flash next 10/05 11:24
77F:→ Sam27: M5 ultra 150~160tok/s > 5090 100~120 > M5 max 70~80 10/05 11:25
78F:→ Sam27: 5080 50~70 > R9700 40~50 > 4070ti 30~40 10/05 11:26
79F:→ Sam27: 我覺得CP值最高5080或4090 10/05 11:27
80F:推 Tosca: M5 ultra有這麼強?! 10/05 11:34
81F:→ Tosca: 我發現要開始玩圖片編輯了話 硬體需求又遠高於純粹t2i這類 10/05 11:34
82F:→ Tosca: 我的mac mini 64GB玩krea2 t2i i2i還算可以 五分鐘出圖 10/05 11:35
83F:→ Tosca: 但要玩image style reference這功能就開始痛苦了 十幾分鐘 10/05 11:35
84F:→ Tosca: 加入了一些國外的色色AI群組 發現圖片編輯才是未來 10/05 11:36
85F:推 newyorker54: 去年六月512g mac 教育價32萬,猶豫了幾天卡在ssd無 10/05 11:36
86F:→ newyorker54: 法自己升級,只有1T,再多要加錢,只好選nvidia 10/05 11:36
87F:→ Tosca: 很多人沒辦法分享prompt是因為他那圖是靠編輯來的 10/05 11:36
88F:→ Sam27: Ultra是GPT估算的,ultra的頻寬蠻高的應該不慢吧 10/05 12:04
89F:→ Sam27: 論壇分享5090還有跑到140tok/s,雙卡4090 120~170都有 10/05 12:05
90F:→ Sam27: Ultra應該比雙卡4090快,但沒5090快...但5090只有32g 10/05 12:06
91F:→ Sam27: 要改圖改影片要無腦目前就只有N卡 10/05 12:07
92F:推 hgs1906: 感謝說明與分享~ 10/05 12:10
93F:推 newyorker54: Qwen flash next Q4, strata不支援,我跑不到60t/s。 10/05 12:16
94F:→ newyorker54: 速度快常常是極度量化,調很久速度拉到50-60t/s就上 10/05 12:16
95F:→ newyorker54: 不去 10/05 12:16
96F:推 h0103661: M5 ultra強在頻寬沒閹割,不然舊版算力也是溢出的,卡 10/05 12:24
97F:→ h0103661: 在記憶體只給你幾百gbps的傳輸速度,新款就沒這個問題 10/05 12:24
98F:→ newyorker54: 買硬體給我的情緒價值高於買車,硬體還不到車價的四 10/05 12:26
99F:→ newyorker54: 分之一,只是祈禱電腦不要故障 10/05 12:26
100F:推 pacino: 怕是養套殺,跟Netflix 一樣越來越貴 10/05 12:51
101F:推 Supasizeit: Q4 能打嗎 我實在很懷疑 10/05 13:07
102F:推 laeva75: strata可以跑UD-IQ4_XS,RAM再大一些的話應該也可以跑U 10/05 13:10
103F:→ laeva75: D-Q4_K_XL,現在很後悔上星期賣掉4x 16GB 10/05 13:10
104F:推 Supasizeit: 我案子有過的話就來買個兩台ultra 256玩玩 10/05 13:12
105F:推 CardLin: PreFill才是重點,10萬token輸入就算pp2000t/s也要花50秒 10/05 13:13
106F:推 laeva75: 最近搞3.8 flash next,從llama.cpp換成exllamav3又換到 10/05 13:17
107F:→ laeva75: strata。decode速度沒差多少,但pp從4xx -> 7xx -> 25x 10/05 13:17
108F:→ laeva75: x t/s 10/05 13:17
109F:→ Sam27: Prefill好像是1~2萬左右 10/05 13:17
110F:推 newyorker54: Q4kxl 和全精度比較,有93%其實相差不多 10/05 13:26
111F:推 GenShoku: 哪來下一代都難產,除了Qwen4系列早已公佈外,GLM 5.5 f 10/05 13:39
112F:→ GenShoku: lash都已經在opencode上被人抓到準備要上線了,Deepseek 10/05 13:39
113F:→ GenShoku: 系列也說過會一直開源下去,我很樂觀明年下半以前有辦法 10/05 13:39
114F:→ GenShoku: 把一套Astra/Fable等級的模型塞在512G ram的Mac或串聯sp 10/05 13:39
115F:→ GenShoku: ark內 10/05 13:39
116F:推 GenShoku: glm5.3還被A\親自認證網路攻擊能力接近mythos級別,這幾 10/05 13:43
117F:→ GenShoku: 天推上還不少人用glm5.3反編譯破解遊戲,本地端真的沒有 10/05 13:44
118F:→ GenShoku: 想像中差,我也靠glm5.3 flash幫我做了好多遊戲mod了 10/05 13:44
119F:→ GenShoku: 欸回錯,回另一篇才對 10/05 13:46
120F:推 newyorker54: glm 5.3 flash q2不知道能力如何?會比qwen flash ne 10/05 13:48
121F:→ newyorker54: xt q4強大嗎? 10/05 13:48
122F:→ gigayaya: 怎麼大家跑幾百B的模型跟喝水一樣簡單 10/05 13:52
123F:→ Sam27: glm5.4是月底,Qwen3.9好像也是月底或下個月 10/05 13:56
124F:→ Sam27: 但跟Claude比其實差距愈來愈大,Opus5.5太誇張的強 10/05 13:56
125F:→ Sam27: Claude根本是六邊形戰士 10/05 13:57
126F:→ h0103661: q2壓過頭了吧,q4算極限了 10/05 14:01
127F:推 newyorker54: qwen4 官宣本星期會出來,什麼時候開源不知道 10/05 14:05
128F:→ guogu: 我只跑得動8B的 哀 太苦惹 10/05 14:21
129F:推 Supasizeit: Opus 讓我基本上大部分時間在手機上寫扣了 這個差距 10/05 14:22
130F:→ Supasizeit: 沒這麼簡單 10/05 14:22
131F:推 immrq: 我自己用Strata跑Qwen3.8-Flash-Nex IQ3 5080+32G 很喘 10/05 14:26
132F:→ immrq: 每秒token才1X 是因為RAM的關係? 看測試可以上 5 60耶... 10/05 14:27
133F:推 GenShoku: 因為astra/opus5.5出來後對岸還沒有旗艦級的模型出來, 10/05 14:28
134F:→ GenShoku: 所以目前也不好評估差距,就看Qwen4系列跟glm新模型出來 10/05 14:28
135F:→ GenShoku: ,才會好比較實際差距 10/05 14:28
136F:推 Sam27: GLM5.3有出來啊,跑分強,但實際用差很多,根本沒人討論 10/05 14:39
137F:推 lordmi: astra 6.1要不是發不出來的話現在也不會變成a\一面倒的優 10/05 14:39
138F:→ lordmi: 勢,年底應該又是御三家都很強的局面。在這之前有便宜的 10/05 14:39
139F:→ lordmi: 訂閱可以趕快買一買,後面大家都要按APIcall算成本了 10/05 14:39
140F:→ Sam27: 現在網路上只有在討論Strata 10/05 14:39
141F:→ Sam27: Kimi平均還是最強拉,但下一代難產,走私的卡不夠用 10/05 14:41
143F:→ lordmi: strata就是用最少5070/64dram和iq3去設計的,要硬塞到更 10/05 14:42
144F:→ lordmi: 低的硬體,結果一定很慘不是你做錯是你本來就硬體不夠 10/05 14:42
145F:推 laeva75: 感覺跑Strata的RAM比VRAM還重要 10/05 14:43
146F:→ Sam27: 這周有Fable 5.2..... 10/05 14:43
149F:→ h0103661: 除非一直都開max或xhigh,不然普通思考用量的御三家還 10/05 14:47
150F:→ h0103661: 沒有開源模型強。 10/05 14:47
151F:→ lordmi: 其實除了做科研以外用旗艦模型的效益很低,保持程式碼簡 10/05 14:48
152F:→ lordmi: 潔比什麼都重要,但是怪模型變笨是個很好的藉口 10/05 14:48
153F:推 GenShoku: glm5.3都老模型了,而且評價沒有不行,只是ds用的人比較 10/05 14:49
154F:→ GenShoku: 多,現在是等5.5 10/05 14:49
155F:推 error405: 前幾天A家特地幫GLM5.3宣傳啊 10/05 14:50
156F:推 rex7788: 現在法規跟不上AI發展速度啊,有個資的東西最終還是被進 10/05 15:16
157F:→ rex7788: 本地 10/05 15:16
159F:→ Sam27: 本地100萬以下機器可以跑最強的就Qwen Next 10/05 15:22
160F:→ zurxgulx: 32g就跑iq2,多少記憶體做多少事 作者自己硬體建議都跑i 10/05 15:23
161F:→ zurxgulx: q2了 那量級、速度和功耗我想不到回去用27b的理由 10/05 15:23
162F:→ Sam27: 這種盲測投票其實算準了,但開源在強都擠不進前10名 10/05 15:23
163F:→ Sam27: 之前都還可以擠進前7~8,現在要前15都很難了 10/05 15:23
164F:→ zurxgulx: 上下文可以開的還比我跑27b高 10/05 15:24
165F:→ Sam27: 美國算力跟晶片是無限的,中國就是只能考走私和海外訓練 10/05 15:25
166F:→ Sam27: 但阿里之前屯了很多晶片,而且阿里海外走私也比較方便 10/05 15:25
167F:→ Sam27: 希望Qwen4能讓人驚豔,擠進前10,起碼要幹掉K3 10/05 15:27
168F:推 shinjikawuru: 2080TI22GB+64GB跑strata+Q3S 50t/s 卡之前買12K... 10/05 15:32
169F:推 ikachann: 雲端絕對比較划算 而且更新速度很快 你本地架起來能跑當 10/05 20:30
170F:→ ikachann: 前的模組 不代表未來新的模組能跑得動 等於你花這筆錢就 10/05 20:30
171F:→ ikachann: 只能用比較低階的模組 要用更心更好的還是要買新硬體 10/05 20:30
172F:推 laeva75: 划不划算難說吧,架了LiteLLM算了自己的token用量,就算 10/05 20:46
173F:→ laeva75: 都用中階模型雲端API的話一個月也要幾百鎂 10/05 20:46
174F:推 Supasizeit: 能拿來賺錢都划算 沒賺錢就爽就好 10/05 22:09
175F:推 JSLee914: 拿閉源的中階思考打開源的max,真虧你想的出來 10/05 23:00
176F:推 jhjhs33504: 文末影片很多細節難怪M6要跳M7如果想試水溫就另當別論 10/05 23:02
177F:→ jhjhs33504: 以現況來說的確是越晚買就越沒有買的必要還分那麼多階 10/05 23:04