作者trfmk1 (TRF小兵)
看板PC_Shopping
標題[心得] ComfyUI 9070XT(ROCm10)專用便攜包分享
時間Thu Aug 27 12:36:48 2026
ComfyUI_Win_portable_RX9070 TRFv0.6.1
https://drive.google.com/file/d/1huOM7MPm5fAlVJeMJbciRxc1nR197nJC/view?usp=drive_link
更新的軌跡
https://forum.gamer.com.tw/C.php?bsn=60030&snA=679332&subbsn=0&threadSubbsn=7&page=1&s_author=&gothis=2543422#2543422
這次更新拖了很久
這是我自己針對9070XT調整的版本
自行更新ComfyUI或者使用第三方啟動器有可能會破壞環境
包內環境是ComfyUI version: 0.34.0
檔案可以任意轉傳出去或者改成其他版本
我不是很在乎這個
ComfyUI本來就是免費的東西
1.Update ROCm.bat更新
可以選擇安裝ROCm10穩定版本
https://i.imgur.com/ykgry79.png
對...ROCm從7直接跳10...
建議使用PyTorch 2.13.0+rocm10.0.0
也可以選擇每夜更新版本
https://i.imgur.com/MiH6cS8.png
新增輸入日期選擇功能
目前還是建議使用PyTorch 2.13.0
2.Start.bat新增變數
微調舒適廚房
主要是Comfy Kitchen Triton 後端
對於int8的模型處理速度目前還是比AMD HIP後端快
https://i.imgur.com/uRe7w3w.png
所以我弄了個節點攔截其中的處理模式
用記事本編輯Start.bat
https://i.imgur.com/HaExCSR.png
set COMFY_KITCHEN_DISABLE_HIP_INT8=0
完全使用HIP後端
set COMFY_KITCHEN_DISABLE_HIP_INT8=1
int8_linear (ConvRot)強制走Triton後端
其餘走HIP後端
3.此版本sage集中力同時有2.2與sage Triton調優版本
需要透過SAGE注意力補丁KJ節點切換
選擇AUTO 使用RDNA4原生內核
選擇sageattn_qk_int8_pv_fp16_triton則切換舊版本
相關參數Start.bat裡面可以微調
新的舒適廚房集中力目前跑跑圖還行
要跑海螺H3 RDNA4內核特化的SAGE注意力還是比較快
壓力很大的環境sage Triton調優版本GPU使用率可能會比較高
請依照自己的硬體環境去調整
4.跑海螺H3如果覺得很吃力
可以將Win系統上的硬件加速 GPU 關閉
https://i.imgur.com/5XJgi4L.png
或者追加comfyui一些自定義參數
https://i.imgur.com/W0et4Jf.png
系統記憶體比較少的環境
可以使用--fast-disk跟--disable-pinned-memory
例如這樣追加參數
set "COMFY_ARGS=%ATTENTION_ARGS% %VRAM_ARGS% %SMART_MEM_ARGS%
--preview-method taesd --vram-headroom 2 --fast-disk"
5.我裝上了機智羅的XB-BOX 小白工具箱
https://github.com/WJLUOXIAO/XB_ToolBox
可以直接銜接機智羅的工作流
https://space.bilibili.com/302329373
如果機智羅的新工作流不能用
記得手動更新他的B-BOX 小白工具箱
ˊ
MiniMax-H3 模型相關位置
https://huggingface.co/Comfy-Org/MiniMax-H3/tree/main
lightx2v加速LORA
https://huggingface.co/lightx2v/Minimax-h3-Turbo/tree/main
Kijai基於lightx2v的修剪版LORA
https://huggingface.co/Kijai/MiniMax-H3_comfy/tree/main/loras
Kijai實驗模型
https://huggingface.co/Kijai/MiniMax-H3-experimental/tree/main
主要是抓取video_vae_int8 convrot版本
minimax_h3_video_vae_int8_convrot.safetensors
裡面W4A8權重的模型雖然比較小
但解包過程帶來的運算
比直接用int8 convrot吃力
反而速度不如用int8
https://huggingface.co/Merserk/MiniMax-H3-INT4-ConvRot/tree/main
主要是抓取 qwen3vl_32b_minimax_h3_int4_convrot.safetensors
空間放大節點
https://huggingface.co/LBH-123-AI/Minimax_h3_latent_Upscaler/tree/main
主要是抓取 minimax_h3_latent_upscaler_3d_bf16.safetensors
Minimax_h3_latent_Upscaler這個主要是在淺空間作放大後
在透過2次採樣補上細節
我在Minimax H3 Latent Upscaler (3D)節點上
做了試配A卡跟一些改造
https://i.imgur.com/eues35G.png
海螺H3內建角色表
https://huggingface.co/datasets/malcolmrey/various/blob/main/h3-center/known-characters/INDEX.md
慎用...裡面很多名人
不要亂搞瑟瑟發佈到網路上
包裡有內建一些工作流
可以去看看B站機智羅的影片拿他的工作流
會學到不少東西
我也有弄個圖生影片的2次採樣放大工作流
https://i.imgur.com/r0Bb75U.png
主要邏輯1采是先跑0.2 20步
2采空間超分 跑1.0 3步
基本上先生成一張圖片
將圖片放到提示詞生成工作流
https://i.imgur.com/pcEe8F2.png
然後很輕鬆就能得到會動的影片了
https://youtube.com/shorts/_lv47plZDeQ
https://youtube.com/shorts/cnvMDMeCuhM?feature=share
也可以直接透過文字生成
https://youtube.com/shorts/g4ZdZ0P91tE?feature=share
https://youtu.be/Q7NfGsyi7A0
https://youtube.com/shorts/iJLH8FhmSpI?feature=share
https://youtube.com/shorts/GhcFHDhKnrA?feature=share
海螺H3本地跑目前還是比較吃重的
模型抓下來也是要不少空間
記憶體建議有64G
32G也不是不能跑
但ComfyUI會使用SSD做緩存
可以先從跑720P 5秒的影片玩起
打打提示詞
就可以生成想要的影片
https://i.imgur.com/s1bnQdn.png
最後提供大絲襪的海螺H3模型
https://drive.google.com/file/d/1k1SMr1-mvn3kPgwB5VswqiA1npcWGD69/view?usp=drive_link
不知道為甚麼前幾天被下架了= =
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 125.229.59.186 (臺灣)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/PC_Shopping/M.1787805417.A.459.html
1F:推 kuroshizu21: 感謝分享, 推 61.227.35.125 08/27 12:41
2F:推 hangtenboy: 我一直在糾結要不要換N卡,還是要906 101.10.5.192 08/27 12:43
3F:→ hangtenboy: 0XT升級9070XT,原Po可以幫幫我嗎? 101.10.5.192 08/27 12:43
如果要問我一律5090
4F:推 ack0011: 買的到買的起拿來當賺錢工具用直接買N卡 49.215.59.195 08/27 12:46
5F:→ ack0011: ,反正還會漲 49.215.59.195 08/27 12:46
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 12:49:22
6F:推 sheng76314: 請問能跑qwen 3.8 27b 嗎 速度大概如 101.9.35.91 08/27 12:55
7F:→ sheng76314: 何 謝謝 101.9.35.91 08/27 12:55
本地想跑LLM
想想硬體跟電費的錢
智力也不如線上的
還是直接買API吧
8F:推 htps0763: 千問27b要玩重點是vram,至少24-32G 101.8.78.194 08/27 13:00
9F:→ htps0763: 才能用q4配個128k 101.8.78.194 08/27 13:00
10F:→ spfy: LLM和繪圖不太一樣 202.173.43.207 08/27 13:06
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 13:07:03
11F:推 hangtenboy: 謝謝原Po... 101.10.5.192 08/27 13:12
12F:→ hangtenboy: 謝謝四樓 101.10.5.192 08/27 13:12
13F:推 iammatrix: Failed to initialize: Bad git execu 118.171.26.180 08/27 13:16
14F:→ iammatrix: 執行START出現ERROR 無法啟動 118.171.26.180 08/27 13:16
15F:→ iammatrix: 'stdlib.h' file not found 118.171.26.180 08/27 13:17
麻煩安裝Microsoft Visual C++ (MSVC)
17F:推 kaj1983: 真人抓胸那片有一瞬間看到六指 36.238.159.13 08/27 13:26
18F:→ kaj1983: 不過應該沒人在乎就是XD 36.238.159.13 08/27 13:27
19F:推 grtfor: 感謝分享,幫助A卡用戶踏入門檻 114.46.191.150 08/27 13:35
20F:→ vsbrm: 玩A卡通常要配合GPT,有問題就丟GPT 42.77.22.73 08/27 13:36
21F:推 gbcg9725: 6樓 9060xt跑qwen 3.8 27b Q4KM 大約9t 39.9.43.10 08/27 13:36
22F:→ gbcg9725: ok/s供參考 39.9.43.10 08/27 13:36
23F:→ gbcg9725: 要用rocm 版本,vulkan 只有6 tok/s 39.9.43.10 08/27 13:37
24F:→ gbcg9725: 9060xt 16g 39.9.43.10 08/27 13:37
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 13:40:10
25F:→ gbcg9725: 16g 經常卡上下文,要拿來寫code 還是 39.9.43.10 08/27 13:50
26F:→ gbcg9725: 不太夠 39.9.43.10 08/27 13:50
27F:→ gbcg9725: 2樓我覺得如果你是要玩影片還是拿n卡 39.9.43.10 08/27 13:54
28F:→ gbcg9725: ,純llm可以拿A 39.9.43.10 08/27 13:54
29F:→ gbcg9725: A卡生影片真的好慢 39.9.43.10 08/27 13:56
30F:推 kanding255: 所以這個便攜包是什麼 。。 1.172.175.182 08/27 14:58
31F:推 hangtenboy: 謝謝樓樓上 101.10.5.192 08/27 15:06
32F:推 ganei: 推!H3要爽跑不知道是否真的要上R9700才行 114.136.135.71 08/27 15:15
33F:→ ganei: ,明(後?)年RDNA5遊戲旗艦卡似乎只有24G... 114.136.135.71 08/27 15:15
34F:→ ganei: 等等,評價反了吧?LLM真的不算A卡強項,反 114.136.135.71 08/27 15:18
35F:→ ganei: 而是有開版這包之後A卡跑圖跑影片不輸N卡了 114.136.135.71 08/27 15:18
36F:→ ganei: ,要煉丹的話另外再說 114.136.135.71 08/27 15:18
海螺H3社群一直在優化
16g顯存的卡跑起來本來就很吃力
9070XT也不是不能跑
至少跑1.0 5秒10秒是算穩定了
環境都弄好
該有的集中力算法都包在裡面了
網路上一堆什麼加速工作流
亂七八糟瞎搞一堆
都是有畫質變差的問題
為了快甚至用上稀疏集中力
我提供這便攜包也是掙扎很久
量化廚房跟動態顯存一直在更新
社群不少人也跳下來優化ROCm HIP後端
每天都有新的東西加入
37F:→ gbcg9725: 還沒試過原po 這版,原生的很慢 27.53.121.203 08/27 15:24
38F:→ gbcg9725: n卡1分鐘的工作流,A卡要6分鐘 27.53.121.203 08/27 15:25
39F:→ gbcg9725: 我是對比4070 27.53.121.203 08/27 15:26
我是不懂你拿5070比9060
然後說A卡跑AI慢是什麼邏輯啦
40F:推 proton63: 推 111.255.28.102 08/27 15:27
41F:推 Tosca: 感覺用A卡和我用mac mini M4差不多爛?! 203.75.79.40 08/27 15:27
42F:推 ack0011: 真的要便宜而且有精力研究在linux上部署 49.215.59.195 08/27 15:29
43F:→ ack0011: ,趕快去找還沒有漲價的AI PRO R9700買 49.215.59.195 08/27 15:29
44F:→ ack0011: 個兩張,不然現在要便宜買新的也沒什麼 49.215.59.195 08/27 15:29
45F:→ ack0011: 能選了 49.215.59.195 08/27 15:29
46F:推 speed7022: 推,雖然我學不會這個使用方法 61.230.78.184 08/27 15:30
47F:推 kanding255: 認真看了一下 謝謝分享 1.172.175.182 08/27 15:42
48F:推 nrsair: AI 125.224.89.222 08/27 15:44
49F:→ lolicat: 好耶 又更新了 每次更新我都能玩上幾天 61.216.36.146 08/27 15:56
50F:→ lolicat: 感謝分享 61.216.36.146 08/27 15:57
51F:推 a2492409g: 推122.121.131.120 08/27 15:57
52F:推 lolicat: 補推 61.216.36.146 08/27 15:58
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 16:00:34
53F:→ gbcg9725: 我是拿4070比9060xt 27.53.121.203 08/27 16:07
54F:→ gbcg9725: 然後我沒有說amd跑ai慢哦,llm兩個差不 27.53.121.203 08/27 16:08
55F:→ gbcg9725: 多,但原生的就是我剛講這個速度 27.53.121.203 08/27 16:08
56F:→ gbcg9725: 請不要斷章取義.. 27.53.121.203 08/27 16:08
這不是斷章取義
9060跟5070本身硬體就不同級
拿來比較本身就沒意義
57F:→ gbcg9725: 原生跑h3 27.53.121.203 08/27 16:09
58F:推 makeitcount: 請問速度如何 我用5070 5秒0.7MP串成 118.165.223.37 08/27 16:09
59F:→ gbcg9725: 生圖的話amd沒有比較差,只針對h3 27.53.121.203 08/27 16:09
60F:→ makeitcount: 15秒MOTIOIN CONTEXT大概430秒 118.165.223.37 08/27 16:10
61F:→ makeitcount: 現在問題是LATENT放大最多1.3MP 118.165.223.37 08/27 16:10
62F:→ makeitcount: 在上去爆VRAM 118.165.223.37 08/27 16:11
63F:→ gbcg9725: 兩個都是用ck-attention 跟官方攜帶版c 27.53.121.203 08/27 16:11
64F:→ gbcg9725: omfy 27.53.121.203 08/27 16:11
65F:→ makeitcount: 早知道AI這麼好玩就買16G了 118.165.223.37 08/27 16:11
66F:→ gbcg9725: 我想可能哪裡設定不對只是提供我自己的 27.53.121.203 08/27 16:12
67F:→ gbcg9725: 結果 27.53.121.203 08/27 16:12
68F:→ makeitcount: 使用TURBO4STEPS跑6步 118.165.223.37 08/27 16:13
69F:→ gbcg9725: h3用a卡跑的資訊真的不多 27.53.121.203 08/27 16:14
70F:→ makeitcount: 430秒指0.7MP跑3次五秒串接 118.165.223.37 08/27 16:14
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 16:16:35
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 16:28:17
71F:→ gbcg9725: 我說4070 12g...為什麼會看成5070 27.53.121.203 08/27 16:29
72F:→ gbcg9725: 4070應該跟9060xt同級? 27.53.121.203 08/27 16:30
73F:→ gbcg9725: 手上還有5070ti就不敢拿來比了 27.53.121.203 08/27 16:35
哈..抱歉我看錯了
正常A卡會慢
是因為加速的集中力算法
大多必須自行編譯
像Sage2自行編譯HIP內核後
才能達到真正的速度
還有一些調優的手段跟N卡不一樣
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 16:41:27
74F:→ gbcg9725: 了解,感謝分享 27.53.121.203 08/27 16:44
75F:推 gohst1234: 新的N卡驅動也能直接調用記憶體了,在系122.117.236.216 08/27 16:48
76F:→ gohst1234: 統遞補政策設定,剛在跑24g模型顯示跟系122.117.236.216 08/27 16:48
77F:→ gohst1234: 統借了8.8g,或許能把分層載入拿掉了122.117.236.216 08/27 16:48
78F:推 hangtenboy: 謝謝分享,等等去光華看哪家有9070XT 101.10.5.192 08/27 16:52
79F:推 sotali306: 推 感謝持續更新 114.36.237.20 08/27 17:26
80F:→ commandoEX: AMD:ROCm 10是最後一版ROCm(X 59.125.204.130 08/27 18:05
81F:→ commandoEX: 剛剛查了Release note,RX9050竟然有 59.125.204.130 08/27 18:09
82F:→ commandoEX: 4GB的版本,這個能跑啥模型??? 59.125.204.130 08/27 18:10
4G跑Anime int8cr模型也行吧
模型大小才2.2~2.3g
83F:推 iwillbehere: 推188.214.106.184 08/27 19:31
84F:推 Shigeru777: 感謝大絲襪模型 之前沒下載到y 61.230.230.98 08/27 19:39
85F:推 d0178411: 同為9070xt用戶推223.143.242.113 08/27 20:37
86F:→ spfy: 那個就傳聞OEM卡 106.64.121.43 08/27 22:29
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 22:37:16
87F:推 xzero0911: N卡推 感謝所有為開源AI貢獻的人 114.34.51.252 08/28 02:32
88F:推 nfsong: 推114.136.163.164 08/28 14:14
89F:推 ejsizmmy: 推回文精妙 101.10.6.126 08/30 09:46
90F:→ ejsizmmy: 27B本地跑用5090不太有機會起得來,然 101.10.6.126 08/30 09:46
91F:→ ejsizmmy: 後5090外加主板設備整組十萬跑不掉,沒 101.10.6.126 08/30 09:47
92F:→ ejsizmmy: 有生產力壓力不如花五千、一萬先買個高 101.10.6.126 08/30 09:47
93F:→ ejsizmmy: 級會員 101.10.6.126 08/30 09:47
94F:推 q1s2c3764: 推 101.10.161.252 08/30 20:34
95F:→ hangtenboy: 換了小石頭的9070XT,讚讚 101.10.3.216 09/01 10:14
96F:→ ganei: 5090的32g單純跑27B Q5 ,上下文可以開到將 111.71.89.51 09/01 10:34
97F:→ ganei: 近200k了,很夠用吧?如果要跟其他東西一起 111.71.89.51 09/01 10:34
98F:→ ganei: 跑那就再說了,慘一點VRAM再多都不夠用 111.71.89.51 09/01 10:34
99F:推 millertw: 請問我跑圖轉影片時START.BAT會跳掉 49.159.0.42 09/02 16:51
100F:→ millertw: 但因為太快無法截圖看原因 因此我就試 49.159.0.42 09/02 16:52
101F:→ millertw: 著跑 測速.BAT 結果 49.159.0.42 09/02 16:53
103F:→ millertw: 請問這要如何解決啊 其實我有問AI 說把 49.159.0.42 09/02 16:54
104F:→ millertw: :MI_MODE_1的set TORCH_BLAS_PREFER_HIP 49.159.0.42 09/02 16:56
105F:→ millertw: BLASLT和set ROCBLAS_USE_HIPBLASLT改0 49.159.0.42 09/02 16:56
106F:→ millertw: 結果就可以跑 但這樣是否就沒加速 謝謝 49.159.0.42 09/02 16:57