作者overdoingism (做過頭主義)
看板PC_Shopping
標題[心得] R9700 + Qwen 3.8 27B 專用 llama 分享
時間Fri Sep 25 15:40:40 2026
最近買了貴死的 AMD AI PRO R9700,就是看準了要跑 Qwen 3.8 27B。
結果這性能真的只能用一地雞毛來形容,完全不知所云,
還有走 ROCm 官方 API 比 Vulkan 通用 API 還慢的這種怪事。
於是我就跟AI商量,能不能把你自己變快點。
Qwen 3.8 27B 上網一番查找,我最終得到了一個
prefill 快很多 + decode 慢不少的版本:
官方Llama.cpp ROCm build +
rdna patchs
https://github.com/stew675/llama-cpp-rdna-boosts
在長上下文,總時長甚至沒贏 LM Studio 自帶的 vulkan 版。
這都是個啥啊,崩潰.....還太早了,我還有好朋友,克勞德
於是我就整包丟去給 Claude opus 5.5,你能幫我搞個縫合怪嗎?
prefill 用 ROCm,decode 用 vulkan?
opus 5.5 想了下,覺得這已經是邪門歪道了,勸我別搞,
他答應幫我修復 ROCm 版。
經過一夜折騰,現在 Windows 的我可以在Q5權重、Q8 KV、26萬上下文、開MTP
得到 850t/s 的 Prefill、35t/s 左右的 decode。
Linux 也能用。
如果有誰有需要,可以在這裡索取:
(我建議是直接讓AI代理來讀)
https://github.com/overdoingism/rdna4-fa-band-wmma/blob/main/AGENT-GUIDE.md
讓蘇媽再次偉大!
不得不說,Qwen 3.8 27B,這量體有這性能,
還能幫 opus 5.5 挑錯,簡直鬼神....
--
有 Opus 5.5 為什麼還要用本地 Qwen 3.8....
因為 Opus 5.5 是借來的,買完顯卡沒錢訂閱了(哭啊)
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 193.148.18.52 (美國)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/PC_Shopping/M.1790322044.A.341.html
※ overdoingism:轉錄至看板 AI 09/25 15:42
※ overdoingism:轉錄至看板 AI_Art 09/25 15:49
1F:→ ZMTL: 我剛開始用地端時這個也不會那個也不會,顯 125.228.55.14 09/25 16:04
2F:→ ZMTL: 卡不會設定,lmstudio或ollama也不會設定 125.228.55.14 09/25 16:04
3F:→ ZMTL: 可以色,但一直跳針,講話三不五時就斷掉 125.228.55.14 09/25 16:05
4F:→ ZMTL: 那時候還是用qwen3.6,我想說地端vllm什麼 125.228.55.14 09/25 16:05
5F:→ ZMTL: 垃圾 125.228.55.14 09/25 16:05
6F:→ ZMTL: 結果後來花點時間... 讓claude全程操辦後, 125.228.55.14 09/25 16:05
7F:→ ZMTL: 現在要多舒服有多舒服,聊天或我人不在電腦 125.228.55.14 09/25 16:05
8F:→ ZMTL: 前半夜自動撈論文、做一堆亂七八糟的工作、 125.228.55.14 09/25 16:06
9F:→ ZMTL: 全部都是qwen3.8(現在)解決,單卡3090跑27B 125.228.55.14 09/25 16:06
10F:→ ZMTL: 結論就是遇到事情不懂就問claude/gpt,但地 125.228.55.14 09/25 16:07
11F:→ ZMTL: 端就是某種買斷制XDy 125.228.55.14 09/25 16:07
12F:→ crimsonmoon9: 兩張可以跑fp8+262k q8_0接近全血版 42.77.4.165 09/25 16:43
13F:推 yeeouo: 讚讚讚 42.76.129.79 09/25 17:03
14F:推 crazyman7011: 注重速度可以參考vllm radiance,但 114.37.144.22 09/25 17:27
15F:→ crazyman7011: 就不是win系統了 114.37.144.22 09/25 17:27
16F:推 jfmf: 也是R9700,OS是CachyOS, vulkan後端,每秒 49.239.74.57 09/25 17:51
17F:→ jfmf: token產出速度約48個。 若用 ROCm, 則速度 49.239.74.57 09/25 17:51
18F:→ jfmf: 掉到每秒38個。 49.239.74.57 09/25 17:51
19F:推 gameguy: 聽GG一句,買顯示卡請買Nvidia,請買Nvid 223.137.80.100 09/25 18:36
20F:→ gameguy: ia,請買Nvidia,很重要一定要說三次,AM 223.137.80.100 09/25 18:36
21F:→ gameguy: D顯示卡別碰,下一代又改成UDNA架構,這 223.137.80.100 09/25 18:36
22F:→ gameguy: 玩意沒出個三代以上別考慮買 223.137.80.100 09/25 18:36
23F:推 d030b: 感謝分享 36.226.213.199 09/25 18:41
24F:→ n3688: N卡漲到他媽媽都認不出來,是有其原因的 49.159.251.120 09/25 19:51
25F:→ kf0916: 雖然天下苦老黃久矣,但N卡狂漲不是沒有 223.143.240.45 09/25 20:03
26F:→ kf0916: 道理的 223.143.240.45 09/25 20:03
27F:推 stradadelsol: 已下一顆5800x3d ddr4再戰十年( 27.53.137.87 09/25 20:28
28F:→ stradadelsol: 靠杯 回錯篇w 27.53.137.87 09/25 20:29
29F:推 kill780215: 玩遊戲才買AMD 要玩本地AI N家屌打 49.216.17.135 09/25 21:19
30F:→ bhmagic: Vulkan Vulkan Vulkan 99.118.209.229 09/25 21:56
31F:→ bhmagic: 其他都是垃圾 99.118.209.229 09/25 21:56
32F:推 Chilloutt: 用apu 不曉得行不行 223.137.80.251 09/25 22:08
33F:→ gbcg9725: ai max 395算力差這個很多 119.77.138.132 09/25 22:10
35F:→ gbcg9725: 不知原po有沒有試這個 119.77.138.132 09/25 22:14
36F:推 jen1121: R9700 應該算最便宜入門的了 61.231.2.246 09/25 22:15
37F:推 kimisawa: 我本來想買耶 感覺太多毛了 68.228.69.69 09/25 22:50
38F:推 a1e: 如果能壓小一點性能損失一點點,一般pc用的ai122.118.138.122 09/25 23:23
39F:→ a1e: 可能會被qwen一統江湖122.118.138.122 09/25 23:24
40F:→ ActionII: 自用真的別考慮n家以外的 42.73.217.11 09/25 23:25
41F:→ ActionII: 這價格可以買兩張5060ti,性能跟方便性 42.73.217.11 09/25 23:27
42F:→ ActionII: 都比這張好 42.73.217.11 09/25 23:27
43F:→ ActionII: 只是最近又漲價了== 42.73.217.11 09/25 23:27
44F:→ ActionII: 要壓小一點,有不少10b的密集模型… 42.73.217.11 09/25 23:28
45F:→ ActionII: 雙5060ti 還支援nvfp4 ,12萬上下文不 42.73.217.11 09/25 23:31
46F:→ ActionII: 壓縮是可行的 42.73.217.11 09/25 23:31
47F:推 deolinwind: N把A打趴在地上,I家在地下 36.237.153.135 09/26 00:32
48F:推 mofass: qwen3.8的問題就是用語太支了 111.250.96.13 09/26 00:43
49F:推 gozule: 我用intel b70在linux跑qwen3.8 27b和9700 223.139.79.56 09/26 01:11
50F:→ gozule: 差不多,卡更便宜,不過參數調一陣子才順 223.139.79.56 09/26 01:11
51F:→ gozule: 要開投機解碼,可以多榨50%以上的decode產 223.139.79.56 09/26 01:13
52F:→ gozule: 出 223.139.79.56 09/26 01:13
53F:推 SRNOB: 你沒調查清楚 因為R9700記憶體頻寬速度慢 111.255.86.153 09/26 08:40
54F:→ SRNOB: 他只是32G而已 111.255.86.153 09/26 08:41
55F:→ SRNOB: 5060ti頻寬也是慢 111.255.86.153 09/26 08:41
56F:推 arnold3: 3.8雲端一堆免費的能用 182.234.101.87 09/26 11:26
57F:推 tanted: 5090 記憶體頻寬是R9700的3倍 價格3倍以上 123.193.229.55 09/26 11:59
58F:推 Layase: 怕 這張這麼貴 只有32g當賣點 223.137.73.117 09/26 12:05
59F:→ Layase: 隨便玩q5沒研究優化大概6x t/s 223.137.73.117 09/26 12:06
60F:→ gbcg9725: 現在顯卡都是看vram 定價的啊.. 119.77.138.132 09/26 12:06
61F:→ Layase: 5090丐版 223.137.73.117 09/26 12:07
62F:推 sheng76314: 買mac更盤 結果還有人出書鼓吹 暈 122.121.66.207 09/26 13:03