PC_Shopping 板


LINE

已买/未买/已付订金(元):未买 预算/用途:40000 / Gemma 4 26B 推理 CPU (中央处理器):AMD Ryzen 5 9600X MB (主机板):Asus ProArt B850-Creator Wifi Neo RAM (记忆体):十诠 T-Create DDR5 6000 CL30 x2 VGA (显示卡):(沿用) Intel Arc Pro B70 32G Cooler (散热器):风魔3 SSD (固态硬碟):(沿用) HDD (硬碟): PSU (电源供应器):振华 Leadex III 850W 金牌/全模/主日 CHASSIS (机壳):联力 Lancool 217 MONITOR (萤幕): Mouse/KB (鼠键): OS (作业系统):Ubuntu 其它 (自填): 总价 (未税/含税):35966 含税 最近实验 B70 推理, 编译 llama.cpp SYCL 版本跑 Gemma 4 26B 速度很满意 不过目前是用 eGPU 的方式跑, 想说乾脆组起来比较省事 这个搭配有没有什麽需要改进的地方呢? -- 世界越快 心则慢 网路越慢 心则快 --



※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 122.117.175.196 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/PC_Shopping/M.1783273286.A.421.html
1F:推 are2: MOE模型用啥跑都很快 但你接受这智商?118.150.170.141 07/06 02:11
2F:→ are2: 长远看别买I卡独显 N家入股後可能会被放生118.150.170.141 07/06 02:11
3F:→ are2: 买张7900XTX生态跟速度都更好 还更便宜118.150.170.141 07/06 02:12
4F:推 are2: 喔 看错 原来卡有了 那剩下随便118.150.170.141 07/06 02:14
5F:→ Litfal: 我也好奇26B不嫌笨吗?1.34.131.99 07/06 02:14
6F:→ shane10222: 本地端有更好的?60.198.151.23 07/06 03:29
7F:→ shane10222: 32GB有其他更好的选择吗?60.198.151.23 07/06 03:30
8F:推 MK47: 好奇这麽笨的模型要用做啥?不甘脆用API吗?36.235.197.109 07/06 04:48
9F:推 TameFoxx: 小模型用dense的比较好182.233.84.193 07/06 04:53
10F:→ TameFoxx: 但输出速度就没办法快182.233.84.193 07/06 04:53
11F:推 saito2190: 你RAM够的情况下,本地跑用Gemma4 31B59.115.148.173 07/06 05:55
12F:→ saito2190: 或Qwen 3.6 27B这种Dense模型智力跟Ag59.115.148.173 07/06 05:55
13F:→ saito2190: ent性能方面都会比较好59.115.148.173 07/06 05:55
14F:→ saito2190: 如果用途比较专一在推理或是写Code,59.115.148.173 07/06 05:56
15F:→ saito2190: 用llama cpp加随便一个qwen 3.5被opus59.115.148.173 07/06 05:56
16F:→ saito2190: 或fable微调过的版本都不错59.115.148.173 07/06 05:56
17F:→ iceyang: 小模型用来养马61.224.176.135 07/06 06:22
18F:推 GenShoku: 本地小MoE模型还是拿来聊天就好,真要干123.192.94.227 07/06 06:25
19F:→ GenShoku: 活,就算慢也是选dense模型稳123.192.94.227 07/06 06:25
20F:推 YCL13: 也是建议由Gemma4 31B或Qwen3.6 27B二选一1.161.178.76 07/06 06:35
推 yenchieh1102: 电供抓大一点,未来再插一张卡(? 42.70.248.221 07/06 08:36 好 der,我改买 Leadex VII 1000W,存点钱再加一张
21F:推 are2: 目前地端天花板就是qwen3.6 27b呀42.70.252.91 07/06 09:23
22F:推 akimu: 真的用过api就会知道中国那几个都是智障101.12.128.32 07/06 11:02
23F:→ akimu: 跑分漂亮长期用下来就是鬼打墙101.12.128.32 07/06 11:03
24F:→ akimu: 来不如直接用美国的 最後也不会比较贵101.12.128.32 07/06 11:03
25F:推 ElrosHsun: 原本也是想本地跑後来还是用dsv4 flas194.114.136.219 07/06 11:26
26F:→ ElrosHsun: h超便宜比电费还省194.114.136.219 07/06 11:26
27F:推 takanasiyaya: 本地端显卡玩qwen3.6 27B或Gemma4 349.216.106.151 07/06 11:37
28F:→ takanasiyaya: 1B没错啊。当然你跟真正大模型比差49.216.106.151 07/06 11:37
29F:→ takanasiyaya: 的还是太远也是事实49.216.106.151 07/06 11:37
30F:→ crimsonmoon9: 两家的MoE都这麽不堪吗?223.139.62.72 07/06 11:40
31F:推 GenShoku: 以gemma4 26b a4b来说,他实际就只是知42.79.123.16 07/06 11:44
32F:→ GenShoku: 识量较多比较聪明的4B模型而已,真的要42.79.123.16 07/06 11:44
33F:→ GenShoku: 长链路推理、作业、写文章,完全没法跟42.79.123.16 07/06 11:44
34F:→ GenShoku: 实打实的27b dense模型相比42.79.123.16 07/06 11:44
35F:→ GenShoku: 目前单卡本地的天花板就是qwen3.6 27b,42.79.123.16 07/06 11:46
36F:→ GenShoku: 找个破限跟opus蒸馏版,基本可以当一个42.79.123.16 07/06 11:46
37F:→ GenShoku: 全能小模型42.79.123.16 07/06 11:46
38F:推 yymeow: 我觉得写文章还行,不过现下买32G的卡主要60.250.130.216 07/06 11:47
39F:→ yymeow: 拿来跑图比较香60.250.130.216 07/06 11:47
40F:→ crimsonmoon9: 原来如此 测试的时候都只看前面跟测223.139.62.72 07/06 11:55
41F:→ crimsonmoon9: TTFT而已没注意到性能差这麽多223.139.62.72 07/06 11:55
42F:推 a29022792: 26ba4b超烂 实际上几乎处於不能用的程223.140.241.146 07/06 12:03
43F:→ a29022792: 度223.140.241.146 07/06 12:03
44F:→ a29022792: 我觉得他比gemini cli的mini?还差 而3.223.140.241.146 07/06 12:05
45F:→ a29022792: 1flash就已经很难用了 处於几乎不能信223.140.241.146 07/06 12:05
46F:→ a29022792: 任的状态223.140.241.146 07/06 12:05
47F:推 GenShoku: Qwen3.6 27b > gemma4 31b > qwen3.6 3542.79.123.16 07/06 12:11
48F:→ GenShoku: b a3b > gemma4 12b > gemma4 26b a4b42.79.123.16 07/06 12:11
49F:推 Bustycat: 聊天倒是比Qwen有感情106.64.128.15 07/06 12:16
50F:推 wei115: gemma 4还是有好处啦 他道德感超强,用解42.79.203.178 07/06 12:25
51F:→ wei115: 锁模型他还会非常激动的指正你,但又不得42.79.203.178 07/06 12:25
52F:→ wei115: 不回答,非常有女骑士的感觉,Qwen就很无42.79.203.178 07/06 12:25
53F:→ wei115: 聊,解锁模型就跟没有羞耻心似的42.79.203.178 07/06 12:25
54F:推 xylophone135: Qwen3.5之後就冷冰冰了哪有感情 114.36.243.126 07/06 12:28
55F:→ xylophone135: Gemma 4 26B A4B用在Agentic确实烂 114.36.243.126 07/06 12:30
56F:→ xylophone135: Qwen3.6 35B A3B稍微好一点 114.36.243.126 07/06 12:30
57F:→ xylophone135: 之後来试试Dense模型 114.36.243.126 07/06 12:30
58F:推 lordmi: 目前20b 以下的MOE只适合档案整理、简单223.140.135.158 07/06 12:50
59F:→ lordmi: shell、摘要、approval 。Agent loop 最223.140.135.158 07/06 12:50
60F:→ lordmi: 低限度的智力的最下限目前还在Qwen3.6-27223.140.135.158 07/06 12:50
61F:→ lordmi: B Gemma 4 31B,+ Q4/Q5 + 100K context223.140.135.158 07/06 12:50
62F:→ lordmi: + 量化 KV加上其他配套至少要48的统一记223.140.135.158 07/06 12:50
63F:→ lordmi: 忆体或者VRAM低於这个规格的机器就别想了223.140.135.158 07/06 12:50
64F:推 setsuha: Gemma 4听起来太涩了ㄅ 220.130.134.10 07/06 12:57
65F:推 pphyy5844548: 请问这样拿来评分英文短文的话,用 27.52.39.7 07/06 13:35
66F:→ pphyy5844548: Qwen 27B可以跑吗? 目前是5080+3 27.52.39.7 07/06 13:35
67F:→ pphyy5844548: 2G RAM 27.52.39.7 07/06 13:35
68F:推 GenShoku: Qwen3.6 27b Q4量化 + 128K上下文 + K Q 42.79.123.16 07/06 13:36
69F:→ GenShoku: 8 + V Q4_1,应该是塞得进32G显卡内啦, 42.79.123.16 07/06 13:36
70F:→ GenShoku: 印象中 42.79.123.16 07/06 13:36
71F:推 stlinman: Qwen 3.6 27B 好像跑的久但完成率可以拉150.116.129.113 07/06 13:36
72F:→ stlinman: 高! 在意品质还是稠密模型会比MoE强啦。150.116.129.113 07/06 13:37
73F:推 GenShoku: 评分文章的需求有点模糊,但摘要应该没 42.79.123.16 07/06 13:45
74F:→ GenShoku: 啥问题,本地小模型指令理解度没有大厂 42.79.123.16 07/06 13:45
75F:→ GenShoku: 线上模型好,需要明确的指令 42.79.123.16 07/06 13:45
※ 编辑: tacovirus (101.9.103.172 台湾), 07/06/2026 13:53:58
76F:推 giantwinter: 26B没用阿 114.137.191.69 07/06 14:08
77F:推 jhjhs33504: MoE伺服器友善强在多终端记忆体利用率 36.228.8.135 07/06 14:38
78F:推 jhjhs33504: 缺点是帐面总参数不是实际活跃参数量 36.228.8.135 07/06 15:24
79F:→ jhjhs33504: 就是用小部分参数当写手 品质不如稠密 36.228.8.135 07/06 15:26
80F:推 Supasizeit: 我看你们是没玩过破防的gemma4203.204.195.174 07/06 17:41
81F:推 pxhome: 你听好了,你的目标是跑AI, 36.230.161.245 07/06 19:58
82F:→ pxhome: 要以GPU优先,其他的CPU & DDR是第几代的 36.230.161.245 07/06 19:58
83F:→ pxhome: 通通都不是重点。 36.230.161.245 07/06 19:58
84F:→ pxhome: 第一主机板一定要找有两条PCIe X16插槽的 36.230.161.245 07/06 19:58
85F:→ pxhome: ,VRAM是你的一切这很重要! 36.230.161.245 07/06 19:58
86F:→ pxhome: GPU请直接拿买N卡, 至少遇到问题用GPT还 36.230.161.245 07/06 19:58
87F:→ pxhome: 能快速帮你解决。 36.230.161.245 07/06 19:58
88F:→ pxhome: N卡在云端上的分支计画资源最丰富,实装 36.230.161.245 07/06 19:58
89F:→ pxhome: 难度也最小,还有NVIDIA 提供的集装箱,下 36.230.161.245 07/06 19:58
90F:→ pxhome: 载及用,省下为了最佳化重新编译的时间也 36.230.161.245 07/06 19:58
91F:→ pxhome: 不用担心安装後搞乱系统,让你把精力放在 36.230.161.245 07/06 19:58
92F:→ pxhome: 产出的品质上。 36.230.161.245 07/06 19:58
93F:→ pxhome: 驱动还是工具链稳定是必须的,在这个基础 36.230.161.245 07/06 19:58
94F:→ pxhome: 上你才能针对需求去切换效果更好的模型。 36.230.161.245 07/06 19:58
95F:→ pxhome: 比如说无道德审查模型,量化版的A卡没有几 36.230.161.245 07/06 19:58
96F:→ pxhome: 个能用。 36.230.161.245 07/06 19:58
97F:→ pxhome: 最後别被I卡的VRAM给骗了,B70 32GB涨价 36.230.161.245 07/06 19:58
98F:→ pxhome: 後的价钱都可以买两张5060 Ti 16GB,实际 36.230.161.245 07/06 19:58
99F:→ pxhome: 上就只是一张吃电290W的3060Ti,算力还不 36.230.161.245 07/06 19:58
100F:→ pxhome: 如5050。 36.230.161.245 07/06 19:58
101F:→ pxhome: 更别提5060Ti X2这个高CP值的组合,NVFP4 36.230.161.245 07/06 19:58
102F:→ pxhome: 用对量化模型产出可以妣美4090,遇到只有F 36.230.161.245 07/06 19:58
103F:→ pxhome: P8的老模型打开FlashAttention 3也可以追 36.230.161.245 07/06 19:58
104F:→ pxhome: 平3090。 36.230.161.245 07/06 19:58
105F:→ pxhome: DDR4 2133 ECC 16GBX4 (6千NTD有找) 36.230.161.245 07/06 19:58
106F:→ pxhome: 5900XT & X570 WS ACE看看还能不能搞到手 36.230.161.245 07/06 19:58
107F:→ pxhome: 。 36.230.161.245 07/06 19:58
108F:→ pxhome: DDR3 1866四通道(频宽接近D5 6K双通道) 36.230.161.245 07/06 19:58
109F:→ pxhome: 但是有些人无法接受洋垃圾,对於DRAM组建2 36.230.161.245 07/06 19:58
110F:→ pxhome: 56GB的成本最低是事实啊! 36.230.161.245 07/06 19:58
111F:→ pxhome: MoE模型相对於稠密模型来说,每次获得到 36.230.161.245 07/06 20:03
112F:→ pxhome: 的结果差异性很大 36.230.161.245 07/06 20:03
113F:→ pxhome: 你将来一定会被B70单卡的推理速度慢到受 36.230.161.245 07/06 20:09
114F:→ pxhome: 不了,再加一张B70让算力达到9070XT单卡 36.230.161.245 07/06 20:09
115F:→ pxhome: 的水平。 36.230.161.245 07/06 20:09
116F:→ pxhome: 32GB通常都是跑30-35B 36.230.161.245 07/06 20:22
117F:推 are2: 26B MOE那水平要我掏钱我都懒118.150.170.141 07/06 21:24
118F:推 jhjhs33504: 26B QAT输出品质约与两倍E4B QAT相当 36.228.8.135 07/06 21:36
119F:推 dsin: ddr3 1866x4 接近 ddr5 6000x2 这什麽笑话? 123.194.245.27 07/06 22:49
120F:→ pxhome: 这不是笑话,自己找图比较 36.230.138.251 07/07 03:43
121F:→ pxhome: 一样的GDDR7 128Bit =896 bit GDDR6 256Bi 36.230.138.251 07/07 03:43
122F:→ pxhome: t 36.230.138.251 07/07 03:43
123F:→ pxhome: 那个896是AI乱加的XD 36.230.138.251 07/07 03:45
124F:→ pxhome: 1866四通道60GB/s(X79) 36.230.138.251 07/07 03:54
125F:→ pxhome: ,6000双通道只有47GB/s因为你用的是AMD 36.230.138.251 07/07 03:54
126F:→ pxhome: 9600X & DDR5 6000已经测到烂了 36.230.138.251 07/07 03:56
127F:→ pxhome: AMD因为IO Die和IF总线,双通道没有吃满, 36.230.138.251 07/07 03:58
128F:→ pxhome: 记忆体性能下降25%左右。 算AI还是挑Intel 36.230.138.251 07/07 03:58
129F:→ pxhome: 比较适合 36.230.138.251 07/07 03:58
130F:→ pxhome: 挑便宜的买即可 36.230.138.251 07/07 04:11
131F:推 ck203l5: 最近也在考虑洋垃圾AI机,低成本双PCIE 12.170.106.26 07/07 05:42
132F:→ ck203l5: 实在太香,顺便借个文请问一下楼上有无 12.170.106.26 07/07 05:42
133F:→ ck203l5: 测过2张5060Ti都跑在PCIE3.0 X8情况下 12.170.106.26 07/07 05:42
134F:→ ck203l5: 跑AI推论效能大概损失多少? 谢谢 12.170.106.26 07/07 05:42
135F:→ ck203l5: 5060Ti大硬伤就是只有物理X8通道,装在洋 12.170.106.26 07/07 05:45
136F:→ ck203l5: 垃圾主机板上最高就只剩下PCIE3 X8而已 12.170.106.26 07/07 05:45
137F:推 yymeow: 我试过两张5060TI,主板是华硕Pro WS Z890 60.250.130.216 07/07 10:59
138F:→ yymeow: ACE SE。撇开PCIe减损的问题,比较大的问 60.250.130.216 07/07 11:00
139F:→ yymeow: 题是要找支援张量并行的部属方案,比如 60.250.130.216 07/07 12:08
140F:→ yymeow: vLLM。下一个问题是要找到适用在vLLM的量 60.250.130.216 07/07 12:09
141F:→ yymeow: 化模型,会比单卡32G的限制要多 60.250.130.216 07/07 12:09
142F:→ yymeow: 例如单卡32G在ollama下很容易就找到qwen 60.250.130.216 07/07 12:11
143F:→ yymeow: 3.6 27Bq4,但是vLLM要在hugging face下找 60.250.130.216 07/07 12:12
144F:→ yymeow: 官方只有提供非量化的,要不就要自己再量 60.250.130.216 07/07 12:12
145F:→ yymeow: 化了 60.250.130.216 07/07 12:12
146F:→ pxhome: 张量平行是假议题,Ollama用对模型也可以 49.216.181.198 07/07 12:49
147F:→ pxhome: 破百Tokens /s, 5060Ti 16GB X2根本不用 49.216.181.198 07/07 12:49
148F:→ pxhome: 去考虑.cpp还是vLLM 49.216.181.198 07/07 12:49
149F:→ pxhome: RTX50初始算力高有本钱折腾,不用搞那些 49.216.181.198 07/07 12:53
150F:→ pxhome: 花里胡俏的,把FlashAttention打开性能自 49.216.181.198 07/07 12:53
151F:→ pxhome: 然就出来 49.216.181.198 07/07 12:53
152F:推 pxhome: PCIe减损也不用担心,只要PCI error值为零 49.216.181.198 07/07 12:56
153F:→ pxhome: , 就算用老旧的PCIe2.0X8对性能影响也不 49.216.181.198 07/07 12:56
154F:→ pxhome: 到5%。 49.216.181.198 07/07 12:56
155F:推 pxhome: 以5060Ti来说,用Ollama跑NV官网公告的Gem 49.216.181.198 07/07 13:13
156F:→ pxhome: ma4 26B如果是线性成长,单卡40T双卡80T四 49.216.181.198 07/07 13:14
157F:→ pxhome: 卡160T但实际上是单卡20T双卡80四卡200。 49.216.181.198 07/07 13:14
158F:→ pxhome: vllm张量平行的增加幅度还没有这麽夸张, 49.216.181.198 07/07 13:14
159F:→ pxhome: 我认为问题要放在第一字的回应延时,四通 49.216.181.198 07/07 13:14
160F:→ pxhome: 道D4 2400 76.8GB/s 最快还要历时0.9秒, 49.216.181.198 07/07 13:14
161F:→ pxhome: 没办法像云端AI那样控制在毫秒等级,目前D 49.216.181.198 07/07 13:14
162F:→ pxhome: 5 8800双通道140GB/s也没有办法做到。 49.216.181.198 07/07 13:14
163F:推 lordmi: Qwen可以双卡llama.cpp 21t/s vLLM 60 t/s 114.45.195.56 07/07 14:30
164F:→ lordmi: 但如果是一次只有 1~2 个 Agent 在运行 114.45.195.56 07/07 14:31
165F:→ lordmi: 部署简单、回应快,那llama体感好 114.45.195.56 07/07 14:33
166F:→ lordmi: 要Interactive Chat 很舒服那就不用考虑 114.45.195.56 07/07 14:37
167F:→ lordmi: vLLM是高并发高用量自己7x24的环境更适合 114.45.195.56 07/07 14:38
168F:推 pxhome: 考虑高并发的话,例如3人同时上线,KV Cac 36.230.138.251 07/07 15:49
169F:→ pxhome: he就只能限制在16K以下, VRAM占用量增加5 36.230.138.251 07/07 15:49
170F:→ pxhome: 0%, 36.230.138.251 07/07 15:49
171F:→ pxhome: 超长上下文比如说100K在部署上的难度显着 36.230.138.251 07/07 15:49
172F:→ pxhome: 增加。 36.230.138.251 07/07 15:49
173F:→ pxhome: 因为VRAM对於本地AI是寸土寸金 36.230.138.251 07/07 15:49
174F:→ pxhome: 所以目前我把它当单机操作,最多就是同时 36.230.138.251 07/07 15:49
175F:→ pxhome: 执行Qwen 3.6 35B和Gemma3 27B无道德审查 36.230.138.251 07/07 15:49
176F:→ pxhome: 模型, 36.230.138.251 07/07 15:49
177F:→ pxhome: 框架之间的差异对我来说无感。 36.230.138.251 07/07 15:49
178F:→ pxhome: 除非将来PEX89096 PCIe5.0 Swtich扩充板量 36.230.138.251 07/07 15:49
179F:→ pxhome: 产,让我可以同时使用6张5060Ti 16GB一共9 36.230.138.251 07/07 15:49
180F:→ pxhome: 6GB,这样vLLM建立家用AI工作站才有意义, 36.230.138.251 07/07 15:49
181F:→ pxhome: 但说不定RTX50会是末代8Pin的60Ti。 36.230.138.251 07/07 15:49
182F:→ pxhome: 商用本地AI的话,首字回应延时必须控制在 36.230.138.251 07/07 15:51
183F:→ pxhome: 毫秒等级, 目前的消费级的平台都不可行。 36.230.138.251 07/07 15:51
184F:→ pxhome: 理想值是0.2-0.3秒 36.230.138.251 07/07 16:47
185F:推 TameFoxx: TTFT毫秒也要看你input长度多少 223.136.127.19 07/07 17:46
186F:→ TameFoxx: 你丢十万以上,云端也没法那麽快 223.136.127.19 07/07 17:47
187F:推 moonkuma: 楼上有个用ai 在乱回答,什麽无审查版模 42.77.46.153 07/07 19:31
188F:→ moonkuma: 型amd不能用,听他在鬼扯全篇都在误导,a 42.77.46.153 07/07 19:31
189F:→ moonkuma: md cpu记忆体没比较慢9800x3d用6000 cl3 42.77.46.153 07/07 19:31
190F:→ moonkuma: 0一样能跑出80-90多gb/s但是模型 oom太 42.77.46.153 07/07 19:31
191F:→ moonkuma: 多到系统记忆体也是会很慢,随之在让ai 42.77.46.153 07/07 19:31
192F:→ moonkuma: agent工作时也会一直超时,另外别去用x9 42.77.46.153 07/07 19:31
193F:→ moonkuma: 9洋垃圾组双卡,1866/2133/2400这种就算 42.77.46.153 07/07 19:31
194F:→ moonkuma: 8通道因为cpu太弱架构太旧我用过反而比 42.77.46.153 07/07 19:31
195F:→ moonkuma: 新平台单卡慢、还不如用单卡限缩一下上 42.77.46.153 07/07 19:31
196F:→ moonkuma: 下文。我个人是用7600x组a+n双卡7900xtx 42.77.46.153 07/07 19:31
197F:→ moonkuma: 跑qwen3.6 27b q4无审查副卡3080 20gb跑 42.77.46.153 07/07 19:31
198F:→ moonkuma: comfyui,试过3080 20gb双卡结果就像前 42.77.46.153 07/07 19:31
199F:→ moonkuma: 面说的卡在平台太老旧之後入手能x8+x8的 42.77.46.153 07/07 19:31
200F:→ moonkuma: am5或intel平台再来试,组双卡可以看看i 42.77.46.153 07/07 19:31
201F:→ moonkuma: ntel平台建构成本比较便宜可以用比较便 42.77.46.153 07/07 19:31
202F:→ moonkuma: 宜的ddr4+z690+12400,另外可以用萤幕不 42.77.46.153 07/07 19:31
203F:→ moonkuma: 接显卡让vram最大化,intel堪用的内显可 42.77.46.153 07/07 19:31
204F:→ moonkuma: 以挂网跑些网游,ram够大可以再挂些模拟 42.77.46.153 07/07 19:31
205F:→ moonkuma: 器,amd apu pcie通道太少 7、9000的2cu 42.77.46.153 07/07 19:31
206F:→ moonkuma: 内显实在太弱了 42.77.46.153 07/07 19:31
207F:推 laeva75: 多卡跑--split-mode layer的话,PCIe影 114.41.11.243 07/07 22:03
208F:→ laeva75: 响也不大吧? 114.41.11.243 07/07 22:03
209F:推 TameFoxx: 是 vllm 用tp串连,pcie影响不大 182.233.84.193 07/07 23:07
210F:推 are2: 前面很多都错误讯息 这篇废楼了118.150.170.141 07/08 02:33
211F:→ pxhome: 双PCIe的主机板越来越少,还要跟M2共享频 36.230.138.251 07/08 06:47
212F:→ pxhome: 宽, 难道要拿SATA硬干? 36.230.138.251 07/08 06:47
213F:推 pxhome: D5 6000 双通最多就是90GB/s 听你在吹? A 36.230.138.251 07/08 06:49
214F:→ pxhome: MD记忆体弱本来就是事实,有多卡需求一定 36.230.138.251 07/08 06:49
215F:→ pxhome: 是上EPYC了, 我只是模拟PCIe2.0对产出的 36.230.138.251 07/08 06:49
216F:→ pxhome: 影响 36.230.138.251 07/08 06:49
217F:推 pxhome: 还说9800X3D? 我从头到尾说的是GPU推理, 36.230.138.251 07/08 06:55
218F:→ pxhome: CPU只是配角 36.230.138.251 07/08 06:55
219F:→ pxhome: 首字延时不是提示词决定,而是你一次最大 36.230.138.251 07/08 06:55
220F:→ pxhome: 生成字数决定的,Gemma4它的上限是8192 36.230.138.251 07/08 06:55
221F:→ pxhome: 是怎样? 讲AMD不好就影响你的股价? 36.230.138.251 07/08 06:57
222F:推 moonkuma: 只会用ai乱答的就别出来丢人,你有真的 42.77.46.153 07/08 13:05
223F:→ moonkuma: 架过本地部署吗?我是实际使用过的心得 42.77.46.153 07/08 13:05
224F:→ moonkuma: 9800x3d ddr5 6000是我的游戏机aida64 42.77.46.153 07/08 13:05
225F:→ moonkuma: 写入我测出来就是90gb/s,我也拿来装过 42.77.46.153 07/08 13:05
226F:→ moonkuma: 本地部署最终还是回归游戏机的使用, 76 42.77.46.153 07/08 13:05
227F:→ moonkuma: 00x a+n双卡是我目前的本地部署,在这之 42.77.46.153 07/08 13:05
228F:→ moonkuma: 前尝试过x570没内显会吃掉一些显存跑ai 42.77.46.153 07/08 13:05
229F:→ moonkuma: 时看yt或开网页查资料都会吃掉不少vram, 42.77.46.153 07/08 13:05
230F:→ moonkuma: 也用过双路8通道加双卡3080一起跑27b q4 42.77.46.153 07/08 13:05
231F:→ moonkuma: q6模型跑起来瓦特计直接突破700w光待机 42.77.46.153 07/08 13:05
232F:→ moonkuma: 就突破150w房间温度都提高几度了,跑35b 42.77.46.153 07/08 13:05
233F:→ moonkuma: moe模型可以降到500w左右但只能对话或 42.77.46.153 07/08 13:05
234F:→ moonkuma: 做简单的工作,我用的是技嘉的c612双路 42.77.46.153 07/08 13:05
235F:→ moonkuma: 主板,当然使用更高阶有双pcie4.0x16的ep 42.77.46.153 07/08 13:05
236F:→ moonkuma: yc可能不会遇到跟我一样双卡速度提升不 42.77.46.153 07/08 13:05
237F:→ moonkuma: 明显,瓶颈应该是在cpu太旧时脉太低,然 42.77.46.153 07/08 13:05
238F:→ moonkuma: 後a黑的你干嘛推epyc你不知道这是amd的c 42.77.46.153 07/08 13:05
239F:→ moonkuma: pu吗?不是说amd的就是慢又有问题吗? 42.77.46.153 07/08 13:05
240F:→ moonkuma: 最後在能耗跟性能取舍最终用了a+n组合 42.77.46.153 07/08 13:05
241F:→ moonkuma: 双卡27b q4到q6都测过,结论日常够用但 42.77.46.153 07/08 13:05
242F:→ moonkuma: 还是会发生鬼打墙乱答,需要花时间调教 42.77.46.153 07/08 13:05
243F:→ moonkuma: ,工作上使用还是线上模型聪明省事多了 42.77.46.153 07/08 13:05
244F:→ moonkuma: 。 42.77.46.153 07/08 13:05
245F:推 oldgooddays: Qwythos Qwable或Ornith这些後天训 114.137.240.30 07/09 12:15
246F:→ oldgooddays: 练过的呢? 114.137.240.30 07/09 12:15
247F:→ oldgooddays: 尤其是dense的? 114.137.240.30 07/09 12:15
248F:→ GenShoku: 要看模型 很多都只针对轻量文本如32K-64114.137.209.158 07/09 14:52
249F:→ GenShoku: K训练的 拉到128K-256K就注意力涣散+思114.137.209.158 07/09 14:52
250F:→ GenShoku: 考无限loop率提高 要自己看好模型训练说114.137.209.158 07/09 14:52
251F:→ GenShoku: 明跟社群实测结果114.137.209.158 07/09 14:52







like.gif 您可能会有兴趣的文章
icon.png[问题/行为] 猫晚上进房间会不会有憋尿问题
icon.pngRe: [闲聊] 选了错误的女孩成为魔法少女 XDDDDDDDDDD
icon.png[正妹] 瑞典 一张
icon.png[心得] EMS高领长版毛衣.墨小楼MC1002
icon.png[分享] 丹龙隔热纸GE55+33+22
icon.png[问题] 清洗洗衣机
icon.png[寻物] 窗台下的空间
icon.png[闲聊] 双极の女神1 木魔爵
icon.png[售车] 新竹 1997 march 1297cc 白色 四门
icon.png[讨论] 能从照片感受到摄影者心情吗
icon.png[狂贺] 贺贺贺贺 贺!岛村卯月!总选举NO.1
icon.png[难过] 羡慕白皮肤的女生
icon.png阅读文章
icon.png[黑特]
icon.png[问题] SBK S1安装於安全帽位置
icon.png[分享] 旧woo100绝版开箱!!
icon.pngRe: [无言] 关於小包卫生纸
icon.png[开箱] E5-2683V3 RX480Strix 快睿C1 简单测试
icon.png[心得] 苍の海贼龙 地狱 执行者16PT
icon.png[售车] 1999年Virage iO 1.8EXi
icon.png[心得] 挑战33 LV10 狮子座pt solo
icon.png[闲聊] 手把手教你不被桶之新手主购教学
icon.png[分享] Civic Type R 量产版官方照无预警流出
icon.png[售车] Golf 4 2.0 银色 自排
icon.png[出售] Graco提篮汽座(有底座)2000元诚可议
icon.png[问题] 请问补牙材质掉了还能再补吗?(台中半年内
icon.png[问题] 44th 单曲 生写竟然都给重复的啊啊!
icon.png[心得] 华南红卡/icash 核卡
icon.png[问题] 拔牙矫正这样正常吗
icon.png[赠送] 老莫高业 初业 102年版
icon.png[情报] 三大行动支付 本季掀战火
icon.png[宝宝] 博客来Amos水蜡笔5/1特价五折
icon.pngRe: [心得] 新鲜人一些面试分享
icon.png[心得] 苍の海贼龙 地狱 麒麟25PT
icon.pngRe: [闲聊] (君の名は。雷慎入) 君名二创漫画翻译
icon.pngRe: [闲聊] OGN中场影片:失踪人口局 (英文字幕)
icon.png[问题] 台湾大哥大4G讯号差
icon.png[出售] [全国]全新千寻侘草LED灯, 水草

请输入看板名称,例如:Soft_Job 或 站内搜寻

TOP