作者overdoingism (做过头主义)
看板PC_Shopping
标题[心得] R9700 + Qwen 3.8 27B 专用 llama 分享
时间Fri Sep 25 15:40:40 2026
最近买了贵死的 AMD AI PRO R9700,就是看准了要跑 Qwen 3.8 27B。
结果这性能真的只能用一地鸡毛来形容,完全不知所云,
还有走 ROCm 官方 API 比 Vulkan 通用 API 还慢的这种怪事。
於是我就跟AI商量,能不能把你自己变快点。
Qwen 3.8 27B 上网一番查找,我最终得到了一个
prefill 快很多 + decode 慢不少的版本:
官方Llama.cpp ROCm build +
rdna patchs
https://github.com/stew675/llama-cpp-rdna-boosts
在长上下文,总时长甚至没赢 LM Studio 自带的 vulkan 版。
这都是个啥啊,崩溃.....还太早了,我还有好朋友,克劳德
於是我就整包丢去给 Claude opus 5.5,你能帮我搞个缝合怪吗?
prefill 用 ROCm,decode 用 vulkan?
opus 5.5 想了下,觉得这已经是邪门歪道了,劝我别搞,
他答应帮我修复 ROCm 版。
经过一夜折腾,现在 Windows 的我可以在Q5权重、Q8 KV、26万上下文、开MTP
得到 850t/s 的 Prefill、35t/s 左右的 decode。
Linux 也能用。
如果有谁有需要,可以在这里索取:
(我建议是直接让AI代理来读)
https://github.com/overdoingism/rdna4-fa-band-wmma/blob/main/AGENT-GUIDE.md
让苏妈再次伟大!
不得不说,Qwen 3.8 27B,这量体有这性能,
还能帮 opus 5.5 挑错,简直鬼神....
--
有 Opus 5.5 为什麽还要用本地 Qwen 3.8....
因为 Opus 5.5 是借来的,买完显卡没钱订阅了(哭啊)
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 193.148.18.52 (美国)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/PC_Shopping/M.1790322044.A.341.html
※ overdoingism:转录至看板 AI 09/25 15:42
※ overdoingism:转录至看板 AI_Art 09/25 15:49
1F:→ ZMTL: 我刚开始用地端时这个也不会那个也不会,显 125.228.55.14 09/25 16:04
2F:→ ZMTL: 卡不会设定,lmstudio或ollama也不会设定 125.228.55.14 09/25 16:04
3F:→ ZMTL: 可以色,但一直跳针,讲话三不五时就断掉 125.228.55.14 09/25 16:05
4F:→ ZMTL: 那时候还是用qwen3.6,我想说地端vllm什麽 125.228.55.14 09/25 16:05
5F:→ ZMTL: 垃圾 125.228.55.14 09/25 16:05
6F:→ ZMTL: 结果後来花点时间... 让claude全程操办後, 125.228.55.14 09/25 16:05
7F:→ ZMTL: 现在要多舒服有多舒服,聊天或我人不在电脑 125.228.55.14 09/25 16:05
8F:→ ZMTL: 前半夜自动捞论文、做一堆乱七八糟的工作、 125.228.55.14 09/25 16:06
9F:→ ZMTL: 全部都是qwen3.8(现在)解决,单卡3090跑27B 125.228.55.14 09/25 16:06
10F:→ ZMTL: 结论就是遇到事情不懂就问claude/gpt,但地 125.228.55.14 09/25 16:07
11F:→ ZMTL: 端就是某种买断制XDy 125.228.55.14 09/25 16:07
12F:→ crimsonmoon9: 两张可以跑fp8+262k q8_0接近全血版 42.77.4.165 09/25 16:43
13F:推 yeeouo: 赞赞赞 42.76.129.79 09/25 17:03
14F:推 crazyman7011: 注重速度可以参考vllm radiance,但 114.37.144.22 09/25 17:27
15F:→ crazyman7011: 就不是win系统了 114.37.144.22 09/25 17:27
16F:推 jfmf: 也是R9700,OS是CachyOS, vulkan後端,每秒 49.239.74.57 09/25 17:51
17F:→ jfmf: token产出速度约48个。 若用 ROCm, 则速度 49.239.74.57 09/25 17:51
18F:→ jfmf: 掉到每秒38个。 49.239.74.57 09/25 17:51
19F:推 gameguy: 听GG一句,买显示卡请买Nvidia,请买Nvid 223.137.80.100 09/25 18:36
20F:→ gameguy: ia,请买Nvidia,很重要一定要说三次,AM 223.137.80.100 09/25 18:36
21F:→ gameguy: D显示卡别碰,下一代又改成UDNA架构,这 223.137.80.100 09/25 18:36
22F:→ gameguy: 玩意没出个三代以上别考虑买 223.137.80.100 09/25 18:36
23F:推 d030b: 感谢分享 36.226.213.199 09/25 18:41
24F:→ n3688: N卡涨到他妈妈都认不出来,是有其原因的 49.159.251.120 09/25 19:51
25F:→ kf0916: 虽然天下苦老黄久矣,但N卡狂涨不是没有 223.143.240.45 09/25 20:03
26F:→ kf0916: 道理的 223.143.240.45 09/25 20:03
27F:推 stradadelsol: 已下一颗5800x3d ddr4再战十年( 27.53.137.87 09/25 20:28
28F:→ stradadelsol: 靠杯 回错篇w 27.53.137.87 09/25 20:29
29F:推 kill780215: 玩游戏才买AMD 要玩本地AI N家屌打 49.216.17.135 09/25 21:19
30F:→ bhmagic: Vulkan Vulkan Vulkan 99.118.209.229 09/25 21:56
31F:→ bhmagic: 其他都是垃圾 99.118.209.229 09/25 21:56
32F:推 Chilloutt: 用apu 不晓得行不行 223.137.80.251 09/25 22:08
33F:→ gbcg9725: ai max 395算力差这个很多 119.77.138.132 09/25 22:10
35F:→ gbcg9725: 不知原po有没有试这个 119.77.138.132 09/25 22:14
36F:推 jen1121: R9700 应该算最便宜入门的了 61.231.2.246 09/25 22:15
37F:推 kimisawa: 我本来想买耶 感觉太多毛了 68.228.69.69 09/25 22:50
38F:推 a1e: 如果能压小一点性能损失一点点,一般pc用的ai122.118.138.122 09/25 23:23
39F:→ a1e: 可能会被qwen一统江湖122.118.138.122 09/25 23:24
40F:→ ActionII: 自用真的别考虑n家以外的 42.73.217.11 09/25 23:25
41F:→ ActionII: 这价格可以买两张5060ti,性能跟方便性 42.73.217.11 09/25 23:27
42F:→ ActionII: 都比这张好 42.73.217.11 09/25 23:27
43F:→ ActionII: 只是最近又涨价了== 42.73.217.11 09/25 23:27
44F:→ ActionII: 要压小一点,有不少10b的密集模型… 42.73.217.11 09/25 23:28
45F:→ ActionII: 双5060ti 还支援nvfp4 ,12万上下文不 42.73.217.11 09/25 23:31
46F:→ ActionII: 压缩是可行的 42.73.217.11 09/25 23:31
47F:推 deolinwind: N把A打趴在地上,I家在地下 36.237.153.135 09/26 00:32
48F:推 mofass: qwen3.8的问题就是用语太支了 111.250.96.13 09/26 00:43
49F:推 gozule: 我用intel b70在linux跑qwen3.8 27b和9700 223.139.79.56 09/26 01:11
50F:→ gozule: 差不多,卡更便宜,不过参数调一阵子才顺 223.139.79.56 09/26 01:11
51F:→ gozule: 要开投机解码,可以多榨50%以上的decode产 223.139.79.56 09/26 01:13
52F:→ gozule: 出 223.139.79.56 09/26 01:13
53F:推 SRNOB: 你没调查清楚 因为R9700记忆体频宽速度慢 111.255.86.153 09/26 08:40
54F:→ SRNOB: 他只是32G而已 111.255.86.153 09/26 08:41
55F:→ SRNOB: 5060ti频宽也是慢 111.255.86.153 09/26 08:41
56F:推 arnold3: 3.8云端一堆免费的能用 182.234.101.87 09/26 11:26
57F:推 tanted: 5090 记忆体频宽是R9700的3倍 价格3倍以上 123.193.229.55 09/26 11:59
58F:推 Layase: 怕 这张这麽贵 只有32g当卖点 223.137.73.117 09/26 12:05
59F:→ Layase: 随便玩q5没研究优化大概6x t/s 223.137.73.117 09/26 12:06
60F:→ gbcg9725: 现在显卡都是看vram 定价的啊.. 119.77.138.132 09/26 12:06
61F:→ Layase: 5090丐版 223.137.73.117 09/26 12:07
62F:推 sheng76314: 买mac更盘 结果还有人出书鼓吹 晕 122.121.66.207 09/26 13:03
63F:推 laeva75: mac有超大统一记忆体啊 110.28.96.95 09/26 15:10
64F:推 Supasizeit: 劲战仔笑开Lexus的没买特203.204.195.174 09/26 15:27
65F:推 wanga10000: 实作推 但你这速度感觉能再优化 推荐 42.72.157.107 09/26 15:44
66F:→ wanga10000: 抡锤者论坛 42.72.157.107 09/26 15:44
67F:→ Sam27: 超大慢也痛苦,目前唯一解就是pro6000111.253.193.242 09/26 17:46
68F:→ ActionII: Mac 的赛道不是这颗模型,是混合专家那 42.73.217.11 09/26 19:26
69F:→ ActionII: 一边,你买128g ram 这模型也是跑不快 42.73.217.11 09/26 19:26
70F:→ ActionII: ,还更贵 42.73.217.11 09/26 19:26