作者Shigeru777 (茂茂)
看板AI_Art
標題[分享] MinimaxH3 Ref2VA 長影片 人物/角色替換
時間Sat Sep 19 15:51:09 2026
最近一直在研究 Minimax H3 的 Ref2VA
目標是製作超越 H3 最大 15 秒生成限制的人物跳舞動畫
並且直接參考原始跳舞影片作人物/背景的替換,保留原始舞蹈
經過了一段時間的研究,以下是一些初步成果
(使用 720x1280p 生成)
#1. ハレ晴レユカイ (文藝復興!!)
原始參考影片:
https://www.youtube.com/watch?v=ptbtv27imT4
參考生影片 & 比較:
https://www.youtube.com/watch?v=deCy78KGV-s
#2. なぜ?謎?!ANSWER
原始參考影片:
https://www.youtube.com/shorts/Ikc3Ed-XOkM
參考生影片 & 比較:
https://www.youtube.com/watch?v=GCoBdHSF4G8
影片製作方式及參數分享
模型: MiniMax-H3 Fused Turbo
https://huggingface.co/MATLOWAI/minimax-h3-fused-turbo-int8-convrot
幾乎是綁定,嘗試幾次切換到其他 Ref2V 模型都無法達到相同的影片生成效果
或許是融合了 Mystic v2 改善 H3 畫面油膩模糊,並提升跳舞影片運動平滑的效果
而且有內嵌 Turbo LoRA,只要設定 8 步 就有不錯的效果,12 步以上就看不出差異
Comfy UI 節點 & 工作流: ComfyUI-MiniMaxH3-TimelineDirector
https://github.com/Songssx/ComfyUI-MiniMaxH3-TimelineDirector
使用範例的 MiniMaxH3全功能合一完全體導演台工作流
雖然有其他的專門製作角色替換影片的工作流,不過試了試感覺還是這個工作流效果最好
而且這個工作流目標是在製作長影片,角色替換只是其中一種功能,還可以再開發研究
工作流運作原理:
原始影片素材
→ 取出選區重疊的影片/圖片/音訊
→ H3 編碼為 reference、Guide、AV latent
→ 每段採樣生成
→ 下一段承接上一段 AV latent 尾端
→ 處理重疊畫格和音訊
→ 合併 Images + Audio
→ Create Video / Save Video
影片製作方式:
1. 原始影片處理
原始參考影片需要使用 FFmpeg 或是 達文西等影像處理軟體改變解析度和幀率(24 fps)
解析度與目標生成影片解析度相同或著是整數倍 or 1/2(例如 720p -> 360p,測試用)
如果不是整數倍率的話,影片生成時間大幅增加,動作遵從效果也會變差
也有試過將影片轉用深度圖 或著是 SAM 3D 抽出白模動作骨架
再用 Blender 生成參考影片
但效果不會比直接用原始影片參考生成好多少,影片生成需要的時間也幾乎沒有變化
2. 素材 & 提示詞準備
素材只需要 處理過的參考影片 + 要替換的角色參考圖 + 背景圖
角色參考圖 + 背景圖 可以用 ChatGPT Image 生成
https://i.urusai.cc/zRI8G.jpg
https://i.urusai.cc/MYOvX.jpg
提示詞使用 AI Agent + h3-prompt-writing skill 生成
(我是用 Qwen3.8-27B + Pi Agent)
只要給 Agent 讀取人物圖 & 背景圖,就可以讓它生成提示詞
重點是要強調 角色替換,保持原本影片的所有動作(不要敘述任何動作細節),保持攝影
機視角不變,使用原始音頻
提示詞範例:
https://i.urusai.cc/YfTLB.jpg
3. 工作流使用
請參考 Github 上面的 README 置入素材&提示詞並生成,這邊只說明一些細節
A. 匯入參考影片後,影片用途選項請選擇 "可編輯參考"
B. 素材分段請將每段的參考時長設定為 9.42秒(226f) 或是 8.71秒(209f)
每個分段重疊 5 ~ 22f,嘗試多次測試找到比較好的每段參數
因為 H3 的 合法影格數為 5 + 17n 幀,所以生成和重疊處理都用這個規則走
我目前實測的結果使用這樣的分段和重疊設定可以最大化的還原原始影片的舞蹈動作
只要偏離這個設定,就很容易發現輸出的影片有動作拖拍子或搶先/重複動作
最後轉得很倉促的現象
C. K採樣器: euler 或 res_multistep, 步驟數: 4 or 8 or 12,
Continue Audio Latent: False
D. 所有參考圖片都需要從 "獨立參考圖片" 區塊拖移到 每個分段的 "參考圖片" 區塊
心得:
1. 雖然說目的是做到角色替換,但本質還是 Ref2VA
H3 需要參考影片影格和提示詞進行生成
原始影片時間越長,動作越複雜,生成解析度越高
就越難完美還原原始影片的舞蹈動作
尤其是再片段切分點左右靠 AV latent 延續的舞蹈片段,蠻容易和原始動作不一樣
Ref2VA的生成方式還是黑盒子,需要多次抽卡才能生成出接近完美的影片
不過以使用舞步複雜、高動態的 ハレ晴レユカイ 和 なぜ?謎?!ANSWER 舞蹈來測
試的結果
H3 Ref2VA 作為人物/背景替換的效果還是很好,值得再研究
2. 使用 Ref2VA 或人物 OR 背景替換相當消耗 GPU 資源
以上述使用的模型/工作流生成 40 秒的 ハレ晴レユカイ 影片來看
(使用 GPU: RTX Pro 6000 Max-Q)
生成 360x640p 的影片要花 500 秒左右 (畫面很糊只能拿來做為預覽驗證用)
生成 720x1280p 的影片,時間爆增到 3700 秒以上
希望 Minimax 能夠再持續精進 H3 模型並開源
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 61.230.198.160 (臺灣)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/AI_Art/M.1789804274.A.DDB.html
※ 編輯: Shigeru777 (61.230.198.160 臺灣), 09/19/2026 15:52:27
1F:推 necrophagist: 推推 很讚 09/19 16:19
2F:推 Supasizeit: 反正都參考影片了,是不是可以分段生?另外表情好像 09/19 16:43
3F:→ Supasizeit: 沒有scail豐富 是不是得prompt 09/19 16:43
4F:推 PCC9169: H3現在人物替換這件事的方式還是很亂.單純如果是要跳舞替 09/19 16:46
5F:→ PCC9169: 換的話.我覺得scail2的方式比較方便.可以選擇替換或是動 09/19 16:46
6F:→ PCC9169: 畫(算是姿勢遷移).而且可以直接長影片.人物也不需要使用 09/19 16:46
7F:→ PCC9169: 角色卡.不過因為生成模式不一樣."有可能"人物細節會變.畢 09/19 16:46
8F:→ PCC9169: 竟不是全面參考人物細節 09/19 16:46
9F:推 PCC9169: 如果人物只是要替換.首幀也不需要對齊.但也可以用免費ai 09/19 16:47
10F:→ PCC9169: 生成一張對齊的圖 09/19 16:47
11F:→ Shigeru777: 表情應該可以在提示詞改 其實我在提示詞是要求不要表 09/19 16:49
12F:→ Shigeru777: 情 09/19 16:49
13F:→ PCC9169: H3是可以改的沒錯.但是我不知道臉紅這件事是否有別的表達 09/19 16:51
14F:→ PCC9169: 我之前試做的I2V.寫到臉紅.那個臉紅就是AI的假臉紅 09/19 16:52
16F:→ Shigeru777: 要指定表情可能要在那個工作流指定分段指定秒數增加表 09/19 16:53
17F:→ Shigeru777: 情敘述吧 09/19 16:53
18F:推 PCC9169: 表情寫在哪沒那麼硬性規定 不過有點離題了 09/19 16:57
19F:→ Shigeru777: 之後想挑戰用SAM 3D抽出動作白模後 在Blender 製作攝 09/19 16:57
20F:→ Shigeru777: 影機運鏡並重新生成參考影片 這樣才能顯現 H3 Ref2VA 09/19 16:57
21F:→ Shigeru777: 的價值 09/19 16:57
22F:→ PCC9169: 單純單人固定跳舞用scail2就可以 09/19 16:57
23F:→ PCC9169: 攝影機運鏡這個東西H3現在有嗎?之前看大陸人玩好像是SD2. 09/19 16:59
24F:→ PCC9169: 5的東西? 09/19 16:59
25F:→ PCC9169: 另外教你一個運鏡的玩法.最近看到的.你完全不需要抽卡 09/19 16:59
26F:推 archangel: 讚讚!我之前用首尾幀接龍的方式接類似影片(動作不變只 09/19 17:00
27F:→ archangel: 換衣服),發現會累積動作誤差,我是用124幀一段,約5-6 09/19 17:00
28F:→ archangel: 段動作就跑到救不回來,後來就讓他每段獨立,接好後貼 09/19 17:00
29F:→ archangel: 上原音訊發現效果還不錯,只要音訊是連續的,動作些微 09/19 17:00
30F:→ archangel: 差異也不會太突兀,而且每段重抽也不會太困難 09/19 17:00
31F:推 PCC9169: 就是你拿幾個瓶子.面紙盒之類都可以.直接拿手去運鏡手機 09/19 17:01
32F:→ PCC9169: 拍攝.然後轉白模(深度模型)再用提示詞去描寫劇本.換個方 09/19 17:01
33F:→ PCC9169: 式說就是手搓攝影運鏡.因為你用SD2.5那個好像要付費 09/19 17:01
35F:→ PCC9169: 參考這個影片~ 09/19 17:04
36F:→ tokikaze: 運鏡現在的H3就有。 09/19 17:59
※ 編輯: Shigeru777 (61.230.198.160 臺灣), 09/19/2026 18:28:46
37F:→ Shigeru777: 一般影片可以這樣處理運鏡 但是要強調精準舞蹈動作時 09/19 18:30
38F:→ Shigeru777: 沒法這樣拍 不可能用提示詞完整描述連續的舞蹈動作 09/19 18:31
40F:→ AoWsL: 略試了一下CodexCli做Blander操作..其實應該是沒這麼難 能 09/19 19:01
41F:→ AoWsL: 做多複雜就不知道 09/19 19:01
42F:→ AoWsL: 剛剛用Codex整理桌面 順便玩了一下安裝操作....建物蠻基本 09/19 19:02
43F:→ AoWsL: 的 09/19 19:02
44F:→ AoWsL: 不過690不能玩到爽就是了 09/19 19:05
45F:推 PCC9169: tokikaze 說的是MONOFORM素形白模預演工作台一樣的東西? 09/19 20:25
46F:→ PCC9169: 777我說的是運鏡和白模玩法.你要跳回舞蹈精準另外一回事 09/19 20:26
47F:推 PCC9169: 而且舞蹈精準這個就是姿勢遷移的範疇.白模只是一個方式而 09/19 20:40
48F:→ PCC9169: 已 09/19 20:40
49F:推 avans: 推分享~ 09/20 00:25
50F:推 lacefairy: 請問如果想換上的人物圖片是真人的話,參考的影片是不 09/20 16:09
51F:→ lacefairy: 是也必須是真人才行?我的參考影片是動畫風格的換了好 09/20 16:10
52F:→ lacefairy: 幾組提示詞了就是沒效果或是效果非常差 09/20 16:11
53F:推 PCC9169: 回樓上 不是~但我不知道你用哪種方式換 09/20 17:18
54F:→ PCC9169: 你可以參考我前面的文 另外補充在推文 09/20 17:18
57F:→ Shigeru777: 提示詞完全沒改 09/20 17:58