前言
之前我们介绍过使用ComfyUI+SD1.5文生图模型+AnimateDiff节点生成视频的方案, 只能生成几秒, 本质上属于动图的范畴, 而且只有纯画面没有声音, 有兴趣可参见文章《ComfyUI实现根据文字生成跳舞视频》
现在很多文生视频模型已经问世了, 比如Seedance2.5模型、MinMax-H3模型、Wan2.2模型、LTX-2模型、HuanYanVideo模型等等, 尤其是最近刚出的Seedance2.5模型, 效果很不错, 人物的表情和动作比上一代更加自然
不过Seedance2.5属于付费模型, 调用成本属实有点高, 作为平民用户,还是老老实实使用 ComfyUI+免费模型的方案,让子弹飞一会儿,用不了多久,免费模型也能实现好的效果
以下是开源视频模型对比表格参考:
| 模型 | 厂商 | 原生音频 | 对口型 | 画质定位 | 开源协议 | 商用/地域限制 | 最佳场景 |
|---|---|---|---|---|---|---|---|
| MiniMax H3 | MiniMax | ✅ 音画同出 | ✅ Ref2VA 参考音频驱动 | 写实中上,文字/Logo 准 | MiniMax H3 社区许可(非 Apache) | 年收>2000 万美元需书面授权;美/欧/英/韩排除在本地权重许可外;界面须标"MiniMax H3" | 带声成片/MV/对口型/广告 |
| Wan 2.2 | 阿里 | ❌ 纯视觉 | ⚠️ S2V 单人准,快歌会飘 | 纯视觉天花板 | Apache-2.0 | 无营收/地域门槛,最干净 | 无声电影感、物理仿真、控动作 |
| LTX-2 | Lightricks | ✅ 音画同出(19B) | ⚠️ 同步有,对口型弱于 H3/S2V | 中(快但偏平滑) | LTX-2 社区许可(非 Apache) | 年收入>1000万美元需商业授权 | 抽卡草稿、快速预览 |
| HunyuanVideo 1.5 | 腾讯 | ❌ 纯视觉 | ❌ 不支持 | 高(1080p 纹理细) | 腾讯混元社区许可(非 Apache,EU/UK/韩排除) | 月活>1 亿需授权 | 高性价比 1080p 空镜、超分底片 |
目前所有开源的音视频模型中, 音画效果最好的当属MinMax-H3了, 矮个子里面挑高个子😂, 所以今天我们就来聊聊如何使用该模型在ComfyUI平台上进行有声视频的生成
模型和节点清单
模型:
通用三大类模型 = 扩散模型 + 条件编码模型 + VAE 模型 , 所有SD工作流都离不开该框架
| 角色 | 模型 | 作用 | 放置目录 |
|---|---|---|---|
| 扩散模型 | minimax_h3_fl2va_pruned_int8_convrot.safetensors (~19.5G) |
扩散主干(DiT)------在潜空间联合去噪,同时生成视频帧与音频;FL2VA 版支持文字/首帧/尾帧生视频 | models/diffusion_models/ |
| 条件编码模型 | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors (~14.6G) |
文本编码器------把提示词(含分镜、运镜、音乐描述)翻译成模型能理解的 conditioning | models/text_encoders/ |
| VAE模型) | minimax_h3_video_vae_fp16.safetensors (~4.9G) minimax_h3_audio_vae_fp32.safetensors (~0.6G) |
视频 VAE 解码器 ------把采样出的视频潜变量还原成 RGB 帧序列 音频 VAE 解码器 ------把音频潜变量还原成 32kHz 立体声(跳舞配乐、脚步声) (两个文件由一个 VAE Loader 加载) | models/vae/ |
| 可选 · 加速模型 | minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 |
负责对现有模型能力进行补充扩展 · Turbo LoRA------8 步加速预览,画质略降 | models/loras/ |
以前SD1.5模型内置条件编码模型和VAE模型, 一个模型顶三个用, 而如今的视频模型由于体积太大, 都是独立存在
节点
通用四大类节点 =加载器 +条件构建 +采样 +解码, 同样也是所有SD工作流通用
| 环节 | 作用 | 包含的具体节点(以H3为例) |
|---|---|---|
| 1. 加载器(Loader) | 把模型权重从硬盘读进显存 | 模型加载器、文本编码器加载器、双VAE加载器 |
| 2. 条件构建(Conditioning) | 把提示词、参考图、尺寸变成模型能读的数值向量 | 文本编码 + 条件注入 + 分辨率选择器 |
| 3. 采样(Sampling) | 在潜空间里一步步去噪,生成最终特征张量 | KSampler(采样器) |
| 4. 解码(Decode) | 把潜空间数值还原成人能看的图片/视频/音频 | VAE 解码 + 音视频合并输出 |
哪怕以后出现更复杂的模型(比如多模态联合生成),这四步也会像「地基」一样垫底。区别只在于每一步内部塞多少东西------H3 因为要同时出视频和音频,所以它的 Loader 多了个音频 VAE,采样时多了音频 shift 参数而已。
工作流
工作流核心链路是4 个加载器 → 条件构建 → 采样 → AV 解码→视频保存。
① 加载区(3 个 Loader = 三大件)
| 节点 | 加载的模型 | 输出口 |
|---|---|---|
UNET Loade |
minimax_h3_fl2va_pruned_int8_convrot.safetensors |
MODEL |
CLIP Loader |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors |
CLIP |
VAE Loader |
minimax_h3_video_vae_fp16.safetensors (~4.9G) minimax_h3_audio_vae_fp32.safetensors (~0.6G) (视频 VAE + 音频 VAE,两个文件) |
VAE |

② 条件与参数区
| 节点 | 作用 | 输入来源 |
|---|---|---|
MiniMaxH3ImageToVideo(T2V/I2V 官方封装节点) |
内置三段式提示词文本框;把 prompt + 三大件 + 分辨率 + 首/尾帧拼成完整 conditioning 与空 AV latent,输出 CONDITIONING + LATENT | model、clip、vae(视频)、prompt、width、height、length,可选 first_frame / last_frame |

③ 采样区
| 节点 | 作用 | 关键参数 |
|---|---|---|
KSampler |
联合视频/音频双 sigma 采样去噪 | seed=12345, steps=20, cfg=1.0, sampler=res_multistep, scheduler=simple |

④ 解码 + 保存区
| 节点 | 作用 | 输入 |
|---|---|---|
VAEDecode(画面)+ VAEDecodeAudio(声音) |
分两路解码 → IMAGE 帧 + AUDIO 波形 | samples + 视频 VAE / 音频 VAE |
VHS_VideoCombine(VHS 插件) |
合成 24fps MP4 并保存 | video(IMAGE)+ 可选 audio(AUDIO) |

连线关系(一图流)
scss
┌─── ① 加载区(三大件)──────────────┐
│ UNETLoader │
│ CLIPLoader │
│ VAELoader (video) │
│ VAELoader (audio) │
└────────────────────────────────────┘
↓ MODEL
┌─── ② 条件构建 ────────────────────┐
│ MiniMaxH3ImageToVideo │
│ (prompt, width/height/length) │
└────────────────────────────────────┘
↓ CONDITIONING / LATENT
┌─── ③ 采样 ────────────────────────┐
│ KSampler (20步, cfg=1.0) │
└────────────────────────────────────┘
↓ SAMPLES
┌─── ④ 解码 + 保存 ─────────────────┐
│ VAEDecode ─→ VHS_VideoCombine │
│ VAEDecodeAudio ─→ (混入音频) │
└────────────────────────────────────┘

关键采样参数(针对跳舞场景)
| 参数 | 值 | 说明 |
|---|---|---|
| cfg (guidance) | 1.0 | ⚠️ H3 已做 guidance distillation,千万别设 7.5,否则边缘硬化、动作崩坏 |
| steps | 20(质量)/ 4-8(Turbo LoRA 加速) | 默认 20 |
| sampler / scheduler | res_multistep / simple | 求快可用 euler / simple |
| 帧数 | 按 17n+5 网格对齐,5秒≈124帧 | Resolution Selector 自动吸附 |
| 分辨率 | 测试 0.4MP(832×480);成品 1344×768 (16:9) | 本地最高 768p 短边;别用 1.0MP(会超 768×1344 像素面积上限) |
| FPS | 24 | 固定 |
具体工作流json代码如下:
json
{
"1": {
"inputs": {
"unet_name": "minimax_h3_fl2va_pruned_int8_convrot.safetensors",
"weight_dtype": "default"
},
"class_type": "UNETLoader",
"_meta": {
"title": "UNet加载器"
}
},
"2": {
"inputs": {
"clip_name": "qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors",
"type": "minimax",
"device": "default"
},
"class_type": "CLIPLoader",
"_meta": {
"title": "加载CLIP"
}
},
"3": {
"inputs": {
"vae_name": "minimax_h3_video_vae_fp16.safetensors"
},
"class_type": "VAELoader",
"_meta": {
"title": "加载VAE"
}
},
"4": {
"inputs": {
"vae_name": "minimax_h3_audio_vae_fp32.safetensors"
},
"class_type": "VAELoader",
"_meta": {
"title": "加载VAE"
}
},
"7": {
"inputs": {
"prompt": "integrated_multimodal_description: cinematic realism, soft natural light, a young woman in a red velvet long dress, dancing alone in a minimalist white studio. medium-full shot, fixed camera with slight push-in. [Shot 1] 0-2s: facing camera, arms rising slowly to shoulder height, weight shifting right to left, elegant. [Shot 2] 2-4s: a fluid 360-degree pirouette, dress spreading outward, hair flowing, stable landing. [Shot 3] 4-5s: return to start, arms descending from overhead, smile to camera, freeze frame. continuous motion, clear rhythm, no limb deformation, consistent identity costume lighting. overall_soundscape: bare feet soft steps on floor, dress rustling air, synced to spin. non_diegetic_music: lyrical piano ~96BPM, bright melody, clear bass on beat 1, aligned to dance, fade out at end.",
"width": 1344,
"height": 768,
"length": 124,
"clip": [
"2",
0
],
"vae": [
"3",
0
]
},
"class_type": "MiniMaxH3ImageToVideo",
"_meta": {
"title": "MiniMax H3 Image to Video"
}
},
"8": {
"inputs": {
"seed": 180855514009551,
"steps": 20,
"cfg": 1,
"sampler_name": "res_multistep",
"scheduler": "simple",
"denoise": 1,
"model": [
"1",
0
],
"positive": [
"7",
0
],
"negative": [
"7",
0
],
"latent_image": [
"7",
1
]
},
"class_type": "KSampler",
"_meta": {
"title": "K采样器"
}
},
"9": {
"inputs": {
"samples": [
"8",
0
],
"vae": [
"3",
0
]
},
"class_type": "VAEDecode",
"_meta": {
"title": "VAE解码"
}
},
"10": {
"inputs": {
"samples": [
"8",
0
],
"vae": [
"4",
0
]
},
"class_type": "VAEDecodeAudio",
"_meta": {
"title": "VAE解码(音频)"
}
},
"11": {
"inputs": {
"frame_rate": 24,
"loop_count": 0,
"filename_prefix": "MiniMax_H3/dancing",
"format": "video/h264-mp4",
"pix_fmt": "yuv420p",
"crf": 20,
"save_metadata": true,
"trim_to_audio": false,
"pingpong": false,
"save_output": true,
"images": [
"9",
0
],
"audio": [
"10",
0
]
},
"class_type": "VHS_VideoCombine",
"_meta": {
"title": "Video Combine 🎥🅥🅗🅢"
}
}
}
复制上面的代码, 点击ComfyUI画布粘贴即可使用
提示词
采用 H3 官方三段式结构:integrated_multimodal_description / overall_soundscape / non_diegetic_music
跳舞必须写清「分镜 + 动作节拍 + 配乐」,否则只会原地抖动
提示词如下:
erlang
integrated_multimodal_description: 写实电影感, 柔和自然光, 一位身穿红色丝绒长裙的年轻女性,
在极简白色舞蹈工作室中央独舞. 中全景, 固定机位轻微推近.
[Shot 1] 0-2秒: 面朝镜头, 双臂由体侧缓缓抬至肩高, 重心由右脚移至左脚, 舒展优雅.
[Shot 2] 2-4秒: 以腰部为轴做一个流畅的360度平转 pirouette, 裙摆随旋转向外展开, 长发轻扬, 落地稳定收束.
[Shot 3] 4-5秒: 回到起始姿态, 双臂由头顶缓缓落下, 面向镜头微笑, 定格结束.
动作连贯, 节奏明确, 肢体无变形, 身份服装光线保持一致.
overall_soundscape: 赤脚踩地板轻微脚步声, 裙摆与空气摩擦细响, 随旋转同步.
non_diegetic_music: 中速约96BPM抒情钢琴曲, 旋律明亮, 每小节第一拍清晰低音, 与舞蹈节拍对齐, 结尾渐弱收束.
如果想要指定人物长相(脸保持一致), 需要把扩散模型由minimax_h3_fl2va_pruned_int8_convrot.safetensors替换成minimax_h3_ref2va_pruned_int8_convrot.safetensors ,并指定参考图
云端生成
视频模型对显卡算力要求比较高, 至少24G显存, 普通电脑完全没法玩, 建议大家使用云端ComfyUI, 比如阿里无影灵构工作站, 每天签到就能领算力, 相当于免费
直接使用现成的镜像包即可:

目前新用户可直接一次性领取200灵豆算力, 可以试试:

如果模型缺失, 还可以上传自定义模型, 通过官方的无影云盘实现本地电脑和云端数据交互:

官网: 点击进入
使用第三方AI平台
目前比较知名的AI视频创作平台有:
- Tapnow:深圳添科智能 旗下的 AI 原生商业视觉创作引擎
- Libtv:LiblibAI(哩布哩布 AI)出品的 AI 视频创作平台,无限画布 +
Skill接口,内部集成了市面主流的数十种视频模型 - Running Hub:基于
ComfyUI架构的 AI 创作平台,兼容ComfyUI JSON、预装 7000-9000+ 节点,其实就是云端ComfyUI - 即梦AI:字节的闭源消费级 AI 视频/图像产品
- Updream :B 站出品的面向 UP 主的AI 视频创作平台
- Seko: 商汤科技出品的 AI 创编一体短剧/短视频创作 Agent,无限画布 + 创作 Agent + Skill 生态,主打短剧/漫剧/音乐 MV/出海多集连续生产
我们需要明白的是, 视频生成的效果和使用的视频模型有关,和你使用什么平台没有太大关系,这就好比同样是聊天工具,扣扣、微信、抖音,你说哪个聊天更强?它们从技术上其实没有本质区别,全看你个人需求,这些 AI 平台也是同样的道理,选一个自己用的顺手且个人认为性价比高的用就行。
平台的目的只是为了降低大众用户的使用门槛,用户不需要了解具体的底层原理,也无需花时间精力自己搭建调试部署软件下载模型等,只要提供相应的需求以及镜头语言提示词即可进行创作
如果你是程序员或者懂底层原理,强烈建议使用 ComfyUI 自己手搓,更加灵活可控,足以应对未来 AI 变化
如果你只是想快速体验一把文生视频的快感, 那么直接上豆包, 方便快捷, 每天有免费的视频生成额度, 一个账号不够, 那就多开几个账号玩😂, 可以用它练练提示词
效果展示
由于我们在工作流中设置的视频生成总帧数是124, 而帧率是24, 所以总共生成5秒的视频, 如果你想生成15秒, 需要在MiniMaxH3ImageToVideo节点中将总帧数改为362, 并将提示词补充够15秒镜头
15秒的跳舞视频如下:
上方15秒视频提示词参考:
sql
integrated_multimodal_description: 真人电影感, 高对比霓虹夜店美学, 暗调环境光配电光蓝/品红/青绿扫光. [Shot 1] 0-2秒: 低角度广角仰拍, 一位身穿黑色反光夹克的女性DJ在升高DJ台后推推子, 手指在CDJ转盘上快速刮碟, 头戴LED环形耳机, 霓虹管字 "NEON" 在身后脉动. 镜头以中幅快速横移(Truck Right)扫过DJ台, 频闪灯每拍切一次颜色. [Shot 2] 2-4秒: 硬切到舞池全景, 几十名年轻人在135BPM节拍下齐跳, 双手举过头顶交叉摆动, 身体左右晃肩, 有人原地蹦跳, 有人做wave. 相机手持跟拍(Tracking Shot)穿入人群, 小幅快速推进, 激光束从头顶扫过雾机, 镜头边缘有意象光晕与色散. [Shot 3] 4-5秒: 切到人群中景, 一位穿银色吊带短裙的舞者正对镜头甩头顿足, 霓虹在她脸上交替投下蓝/粉光斑, 背景虚化的人海继续跳动. 镜头在最后一拍做轻微慢动作(Roll Counterclockwise小幅)后切回实时, 定格在众人跃起瞬间. 全程人物服装/发型/光线一致, 肢体无变形, 动作与135BPM鼓点严格对齐.
overall_soundscape: 厚底靴踩地闷响, 液体在玻璃杯里晃动, 雾机喷气嘶声, 人群合唱式喊拍"嘿!嘿!", 近距离衣物摩擦与呼吸声, 音箱低频在胸腔共振的体感轰鸣.
non_diegetic_music: 135BPM 商业DJ舞曲, 四四拍底鼓每拍清晰, 副歌前_buildup_用滚奏hi-hat与上升synth riser, drop段重低音bassline+失真lead+紧凑clap, 间奏切到filter sweep与crowd vocal chop, 整体动态从intro克制到drop全频炸开, 结尾留2拍echo尾音.
由于掘金的限制, 本文图片上传不完全, 更多关于AI相关的内容可以关注公众号《乱码三千》
本文为作者原创 转载时请注明出处 谢谢