顯示廣告
隱藏 ✕
※ 本文轉寄自 ptt.cc 更新時間: 2026-08-27 17:45:20
看板 PC_Shopping
作者 trfmk1 (TRF小兵)
標題 [心得] ComfyUI 9070XT(ROCm10)專用便攜包分享
時間 Thu Aug 27 12:36:48 2026


ComfyUI_Win_portable_RX9070 TRFv0.6.1

https://drive.google.com/file/d/1huOM7MPm5fAlVJeMJbciRxc1nR197nJC/view?usp=drive_link

更新的軌跡

https://forum.gamer.com.tw/C.php?bsn...or=&gothis=2543422#2543422

這次更新拖了很久
這是我自己針對9070XT調整的版本
自行更新ComfyUI或者使用第三方啟動器有可能會破壞環境

包內環境是ComfyUI version: 0.34.0

檔案可以任意轉傳出去或者改成其他版本
我不是很在乎這個
ComfyUI本來就是免費的東西


1.Update ROCm.bat更新

可以選擇安裝ROCm10穩定版本
https://i.imgur.com/ykgry79.png
[圖]
對...ROCm從7直接跳10...
建議使用PyTorch 2.13.0+rocm10.0.0

也可以選擇每夜更新版本
https://i.imgur.com/MiH6cS8.png
[圖]
新增輸入日期選擇功能
目前還是建議使用PyTorch 2.13.0


2.Start.bat新增變數

微調舒適廚房
主要是Comfy Kitchen Triton 後端
對於int8的模型處理速度目前還是比AMD HIP後端快
https://i.imgur.com/uRe7w3w.png
[圖]

所以我弄了個節點攔截其中的處理模式

用記事本編輯Start.bat
https://i.imgur.com/HaExCSR.png
[圖]

set COMFY_KITCHEN_DISABLE_HIP_INT8=0
完全使用HIP後端

set COMFY_KITCHEN_DISABLE_HIP_INT8=1
int8_linear (ConvRot)強制走Triton後端
其餘走HIP後端


3.此版本sage集中力同時有2.2與sage Triton調優版本
需要透過SAGE注意力補丁KJ節點切換
選擇AUTO 使用RDNA4原生內核
選擇sageattn_qk_int8_pv_fp16_triton則切換舊版本

相關參數Start.bat裡面可以微調

新的舒適廚房集中力目前跑跑圖還行
要跑海螺H3 RDNA4內核特化的SAGE注意力還是比較快

壓力很大的環境sage Triton調優版本GPU使用率可能會比較高
請依照自己的硬體環境去調整


4.跑海螺H3如果覺得很吃力
可以將Win系統上的硬件加速 GPU 關閉
https://i.imgur.com/5XJgi4L.png
[圖]

或者追加comfyui一些自定義參數
https://i.imgur.com/W0et4Jf.png
[圖]

系統記憶體比較少的環境
可以使用--fast-disk跟--disable-pinned-memory

例如這樣追加參數
set "COMFY_ARGS=%ATTENTION_ARGS% %VRAM_ARGS% %SMART_MEM_ARGS%
--preview-method taesd --vram-headroom 2 --fast-disk"


5.我裝上了機智羅的XB-BOX 小白工具箱
https://github.com/WJLUOXIAO/XB_ToolBox
可以直接銜接機智羅的工作流
https://space.bilibili.com/302329373

如果機智羅的新工作流不能用
記得手動更新他的B-BOX 小白工具箱
ˊ

MiniMax-H3 模型相關位置
https://huggingface.co/Comfy-Org/MiniMax-H3/tree/main

lightx2v加速LORA
https://huggingface.co/lightx2v/Minimax-h3-Turbo/tree/main

Kijai基於lightx2v的修剪版LORA
https://huggingface.co/Kijai/MiniMax-H3_comfy/tree/main/loras

Kijai實驗模型
https://huggingface.co/Kijai/MiniMax-H3-experimental/tree/main
主要是抓取video_vae_int8 convrot版本
minimax_h3_video_vae_int8_convrot.safetensors

裡面W4A8權重的模型雖然比較小
但解包過程帶來的運算
比直接用int8 convrot吃力
反而速度不如用int8

https://huggingface.co/Merserk/MiniMax-H3-INT4-ConvRot/tree/main
主要是抓取 qwen3vl_32b_minimax_h3_int4_convrot.safetensors

空間放大節點
https://huggingface.co/LBH-123-AI/Minimax_h3_latent_Upscaler/tree/main
主要是抓取 minimax_h3_latent_upscaler_3d_bf16.safetensors

Minimax_h3_latent_Upscaler這個主要是在淺空間作放大後
在透過2次採樣補上細節
我在Minimax H3 Latent Upscaler (3D)節點上
做了試配A卡跟一些改造
https://i.imgur.com/eues35G.png
[圖]

海螺H3內建角色表

https://huggingface.co/datasets/malcolmrey/various/blob/main/h3-center/known-characters/INDEX.md

慎用...裡面很多名人
不要亂搞瑟瑟發佈到網路上

包裡有內建一些工作流
可以去看看B站機智羅的影片拿他的工作流
會學到不少東西

我也有弄個圖生影片的2次採樣放大工作流
https://i.imgur.com/r0Bb75U.png
[圖]
主要邏輯1采是先跑0.2 20步
2采空間超分 跑1.0 3步

基本上先生成一張圖片
將圖片放到提示詞生成工作流
https://i.imgur.com/pcEe8F2.png
[圖]

然後很輕鬆就能得到會動的影片了
https://youtube.com/shorts/_lv47plZDeQ

https://youtube.com/shorts/cnvMDMeCuhM?feature=share

也可以直接透過文字生成
https://youtube.com/shorts/g4ZdZ0P91tE?feature=share

https://youtu.be/Q7NfGsyi7A0

https://youtube.com/shorts/iJLH8FhmSpI?feature=share

https://youtube.com/shorts/GhcFHDhKnrA?feature=share

海螺H3本地跑目前還是比較吃重的
模型抓下來也是要不少空間
記憶體建議有64G
32G也不是不能跑
但ComfyUI會使用SSD做緩存
可以先從跑720P 5秒的影片玩起

打打提示詞
就可以生成想要的影片
https://i.imgur.com/s1bnQdn.png
[圖]

最後提供大絲襪的海螺H3模型

https://drive.google.com/file/d/1k1SMr1-mvn3kPgwB5VswqiA1npcWGD69/view?usp=drive_link
不知道為甚麼前幾天被下架了= =

--
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 125.229.59.186 (臺灣)
※ 作者: trfmk1 2026-08-27 12:36:48
※ 文章代碼(AID): #1gZxxfHP (PC_Shopping)
※ 文章網址: https://www.ptt.cc/bbs/PC_Shopping/M.1787805417.A.459.html
kuroshizu21: 感謝分享, 推1F 61.227.35.125 台灣 08/27 12:41
hangtenboy: 我一直在糾結要不要換N卡,還是要9062F 101.10.5.192 台灣 08/27 12:43
hangtenboy: 0XT升級9070XT,原Po可以幫幫我嗎?
如果要問我一律5090
ack0011: 買的到買的起拿來當賺錢工具用直接買N卡4F 49.215.59.195 台灣 08/27 12:46
ack0011: ,反正還會漲
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 12:49:22
sheng76314: 請問能跑qwen 3.8 27b 嗎 速度大概如6F 101.9.35.91 台灣 08/27 12:55
sheng76314: 何 謝謝
本地想跑LLM
想想硬體跟電費的錢
智力也不如線上的
還是直接買API吧
htps0763: 千問27b要玩重點是vram,至少24-32G8F 101.8.78.194 台灣 08/27 13:00
htps0763: 才能用q4配個128k
spfy: LLM和繪圖不太一樣10F 202.173.43.207 台灣 08/27 13:06
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 13:07:03
hangtenboy: 謝謝原Po...11F 101.10.5.192 台灣 08/27 13:12
hangtenboy: 謝謝四樓
iammatrix:  Failed to initialize: Bad git execu13F 118.171.26.180 台灣 08/27 13:16
iammatrix: 執行START出現ERROR 無法啟動
iammatrix:  'stdlib.h' file not found
iammatrix: https://i.meee.com.tw/Fe62vy8.png
[圖]
麻煩安裝Microsoft Visual C++ (MSVC)
kaj1983: 真人抓胸那片有一瞬間看到六指17F 36.238.159.13 台灣 08/27 13:26
kaj1983: 不過應該沒人在乎就是XD
grtfor: 感謝分享,幫助A卡用戶踏入門檻19F 114.46.191.150 台灣 08/27 13:35
vsbrm: 玩A卡通常要配合GPT,有問題就丟GPT20F 42.77.22.73 台灣 08/27 13:36
gbcg9725: 6樓 9060xt跑qwen 3.8 27b Q4KM 大約9t21F 39.9.43.10 台灣 08/27 13:36
gbcg9725: ok/s供參考
gbcg9725: 要用rocm 版本,vulkan 只有6 tok/s
gbcg9725: 9060xt 16g
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 13:40:10
gbcg9725: 16g 經常卡上下文,要拿來寫code 還是25F 39.9.43.10 台灣 08/27 13:50
gbcg9725: 不太夠
gbcg9725: 2樓我覺得如果你是要玩影片還是拿n卡
gbcg9725: ,純llm可以拿A
gbcg9725: A卡生影片真的好慢
kanding255: 所以這個便攜包是什麼 。。30F 1.172.175.182 台灣 08/27 14:58
hangtenboy: 謝謝樓樓上31F 101.10.5.192 台灣 08/27 15:06
ganei: 推!H3要爽跑不知道是否真的要上R9700才行32F 114.136.135.71 台灣 08/27 15:15
ganei: ,明(後?)年RDNA5遊戲旗艦卡似乎只有24G...
ganei: 等等,評價反了吧?LLM真的不算A卡強項,反
ganei: 而是有開版這包之後A卡跑圖跑影片不輸N卡了
ganei: ,要煉丹的話另外再說
海螺H3社群一直在優化
16g顯存的卡跑起來本來就很吃力
9070XT也不是不能跑
至少跑1.0 5秒10秒是算穩定了
環境都弄好
該有的集中力算法都包在裡面了

網路上一堆什麼加速工作流
亂七八糟瞎搞一堆
都是有畫質變差的問題
為了快甚至用上稀疏集中力

我提供這便攜包也是掙扎很久
量化廚房跟動態顯存一直在更新
社群不少人也跳下來優化ROCm HIP後端
每天都有新的東西加入
gbcg9725: 還沒試過原po 這版,原生的很慢37F 27.53.121.203 台灣 08/27 15:24
gbcg9725: n卡1分鐘的工作流,A卡要6分鐘
gbcg9725: 我是對比4070
我是不懂你拿5070比9060
然後說A卡跑AI慢是什麼邏輯啦
proton63: 推40F 111.255.28.102 台灣 08/27 15:27
Tosca: 感覺用A卡和我用mac mini M4差不多爛?!41F 203.75.79.40 台灣 08/27 15:27
ack0011: 真的要便宜而且有精力研究在linux上部署42F 49.215.59.195 台灣 08/27 15:29
ack0011: ,趕快去找還沒有漲價的AI PRO R9700買
ack0011: 個兩張,不然現在要便宜買新的也沒什麼
ack0011: 能選了
speed7022: 推,雖然我學不會這個使用方法46F 61.230.78.184 台灣 08/27 15:30
kanding255: 認真看了一下 謝謝分享47F 1.172.175.182 台灣 08/27 15:42
nrsair: AI48F 125.224.89.222 台灣 08/27 15:44
lolicat: 好耶 又更新了 每次更新我都能玩上幾天49F 61.216.36.146 台灣 08/27 15:56
lolicat: 感謝分享
a2492409g: 推51F 122.121.131.120 台灣 08/27 15:57
lolicat: 補推52F 61.216.36.146 台灣 08/27 15:58
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 16:00:34
gbcg9725: 我是拿4070比9060xt53F 27.53.121.203 台灣 08/27 16:07
gbcg9725: 然後我沒有說amd跑ai慢哦,llm兩個差不
gbcg9725: 多,但原生的就是我剛講這個速度
gbcg9725: 請不要斷章取義..
這不是斷章取義
9060跟5070本身硬體就不同級
拿來比較本身就沒意義
gbcg9725: 原生跑h357F 27.53.121.203 台灣 08/27 16:09
makeitcount: 請問速度如何 我用5070 5秒0.7MP串成58F 118.165.223.37 台灣 08/27 16:09
gbcg9725: 生圖的話amd沒有比較差,只針對h359F 27.53.121.203 台灣 08/27 16:09
makeitcount: 15秒MOTIOIN CONTEXT大概430秒60F 118.165.223.37 台灣 08/27 16:10
makeitcount: 現在問題是LATENT放大最多1.3MP
makeitcount: 在上去爆VRAM
gbcg9725: 兩個都是用ck-attention 跟官方攜帶版c63F 27.53.121.203 台灣 08/27 16:11
gbcg9725: omfy
makeitcount: 早知道AI這麼好玩就買16G了65F 118.165.223.37 台灣 08/27 16:11
gbcg9725: 我想可能哪裡設定不對只是提供我自己的66F 27.53.121.203 台灣 08/27 16:12
gbcg9725: 結果
makeitcount: 使用TURBO4STEPS跑6步68F 118.165.223.37 台灣 08/27 16:13
gbcg9725: h3用a卡跑的資訊真的不多69F 27.53.121.203 台灣 08/27 16:14
makeitcount: 430秒指0.7MP跑3次五秒串接70F 118.165.223.37 台灣 08/27 16:14
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 16:16:35
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 16:28:17
gbcg9725: 我說4070 12g...為什麼會看成507071F 27.53.121.203 台灣 08/27 16:29
gbcg9725: 4070應該跟9060xt同級?
gbcg9725: 手上還有5070ti就不敢拿來比了
哈..抱歉我看錯了
正常A卡會慢
是因為加速的集中力算法
大多必須自行編譯
像Sage2自行編譯HIP內核後
才能達到真正的速度
還有一些調優的手段跟N卡不一樣
※ 編輯: trfmk1 (125.229.59.186 臺灣), 08/27/2026 16:41:27
gbcg9725: 了解,感謝分享74F 27.53.121.203 台灣 08/27 16:44
gohst1234: 新的N卡驅動也能直接調用記憶體了,在系75F 122.117.236.216 台灣 08/27 16:48
gohst1234: 統遞補政策設定,剛在跑24g模型顯示跟系
gohst1234: 統借了8.8g,或許能把分層載入拿掉了
hangtenboy: 謝謝分享,等等去光華看哪家有9070XT78F 101.10.5.192 台灣 08/27 16:52
sotali306: 推 感謝持續更新79F 114.36.237.20 台灣 08/27 17:26

--
※ 看板: PC_Shopping 文章推薦值: 0 目前人氣: 0 累積人氣: 25 
分享網址: 複製 已複製
guest
x)推文 r)回覆 e)編輯 d)刪除 M)收藏 ^x)轉錄 同主題: =)首篇 [)上篇 ])下篇