使用ComfyUI+MinMax-H3音视频模型生成视频

前言

之前我们介绍过使用ComfyUI+SD1.5文生图模型+AnimateDiff节点生成视频的方案, 只能生成几秒, 本质上属于动图的范畴, 而且只有纯画面没有声音, 有兴趣可参见文章《ComfyUI实现根据文字生成跳舞视频

现在很多文生视频模型已经问世了, 比如Seedance2.5模型、MinMax-H3模型、Wan2.2模型、LTX-2模型、HuanYanVideo模型等等, 尤其是最近刚出的Seedance2.5模型, 效果很不错, 人物的表情和动作比上一代更加自然

不过Seedance2.5属于付费模型, 调用成本属实有点高, 作为平民用户,还是老老实实使用 ComfyUI+免费模型的方案,让子弹飞一会儿,用不了多久,免费模型也能实现好的效果

以下是开源视频模型对比表格参考:

模型 厂商 原生音频 对口型 画质定位 开源协议 商用/地域限制 最佳场景
MiniMax H3 MiniMax ✅ 音画同出 ✅ Ref2VA 参考音频驱动 写实中上,文字/Logo 准 MiniMax H3 社区许可(非 Apache) 年收>2000 万美元需书面授权;美/欧/英/韩排除在本地权重许可外;界面须标"MiniMax H3" 带声成片/MV/对口型/广告
Wan 2.2 阿里 ❌ 纯视觉 ⚠️ S2V 单人准,快歌会飘 纯视觉天花板 Apache-2.0 无营收/地域门槛,最干净 无声电影感、物理仿真、控动作
LTX-2 Lightricks ✅ 音画同出(19B) ⚠️ 同步有,对口型弱于 H3/S2V 中(快但偏平滑) LTX-2 社区许可(非 Apache) 年收入>1000万美元需商业授权 抽卡草稿、快速预览
HunyuanVideo 1.5 腾讯 ❌ 纯视觉 ❌ 不支持 高(1080p 纹理细) 腾讯混元社区许可(非 Apache,EU/UK/韩排除) 月活>1 亿需授权 高性价比 1080p 空镜、超分底片

目前所有开源的音视频模型中, 音画效果最好的当属MinMax-H3了, 矮个子里面挑高个子😂, 所以今天我们就来聊聊如何使用该模型在ComfyUI平台上进行有声视频的生成

模型和节点清单

模型:

通用三大类模型 = 扩散模型 + 条件编码模型 + VAE 模型 , 所有SD工作流都离不开该框架

角色 模型 作用 放置目录
扩散模型 minimax_h3_fl2va_pruned_int8_convrot.safetensors (~19.5G) 扩散主干(DiT)------在潜空间联合去噪,同时生成视频帧与音频;FL2VA 版支持文字/首帧/尾帧生视频 models/diffusion_models/
条件编码模型 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors (~14.6G) 文本编码器------把提示词(含分镜、运镜、音乐描述)翻译成模型能理解的 conditioning models/text_encoders/
VAE模型) minimax_h3_video_vae_fp16.safetensors (~4.9G) minimax_h3_audio_vae_fp32.safetensors (~0.6G) 视频 VAE 解码器 ------把采样出的视频潜变量还原成 RGB 帧序列 音频 VAE 解码器 ------把音频潜变量还原成 32kHz 立体声(跳舞配乐、脚步声) (两个文件由一个 VAE Loader 加载) models/vae/
可选 · 加速模型 minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 负责对现有模型能力进行补充扩展 · Turbo LoRA------8 步加速预览,画质略降 models/loras/

以前SD1.5模型内置条件编码模型和VAE模型, 一个模型顶三个用, 而如今的视频模型由于体积太大, 都是独立存在

节点

通用四大类节点 =加载器 +条件构建 +采样 +解码, 同样也是所有SD工作流通用

环节 作用 包含的具体节点(以H3为例)
1. 加载器(Loader) 把模型权重从硬盘读进显存 模型加载器、文本编码器加载器、双VAE加载器
2. 条件构建(Conditioning) 把提示词、参考图、尺寸变成模型能读的数值向量 文本编码 + 条件注入 + 分辨率选择器
3. 采样(Sampling) 在潜空间里一步步去噪,生成最终特征张量 KSampler(采样器)
4. 解码(Decode) 把潜空间数值还原成人能看的图片/视频/音频 VAE 解码 + 音视频合并输出

哪怕以后出现更复杂的模型(比如多模态联合生成),这四步也会像「地基」一样垫底。区别只在于每一步内部塞多少东西------H3 因为要同时出视频和音频,所以它的 Loader 多了个音频 VAE,采样时多了音频 shift 参数而已。


工作流

工作流核心链路是4 个加载器 → 条件构建 → 采样 → AV 解码→视频保存

① 加载区(3 个 Loader = 三大件)

节点 加载的模型 输出口
UNET Loade minimax_h3_fl2va_pruned_int8_convrot.safetensors MODEL
CLIP Loader qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors CLIP
VAE Loader minimax_h3_video_vae_fp16.safetensors (~4.9G) minimax_h3_audio_vae_fp32.safetensors (~0.6G) (视频 VAE + 音频 VAE,两个文件) VAE

② 条件与参数区

节点 作用 输入来源
MiniMaxH3ImageToVideoT2V/I2V 官方封装节点 内置三段式提示词文本框;把 prompt + 三大件 + 分辨率 + 首/尾帧拼成完整 conditioning 与空 AV latent,输出 CONDITIONING + LATENT model、clip、vae(视频)、prompt、width、height、length,可选 first_frame / last_frame

③ 采样区

节点 作用 关键参数
KSampler 联合视频/音频双 sigma 采样去噪 seed=12345, steps=20, cfg=1.0, sampler=res_multistep, scheduler=simple

④ 解码 + 保存区

节点 作用 输入
VAEDecode(画面)+ VAEDecodeAudio(声音) 分两路解码 → IMAGE 帧 + AUDIO 波形 samples + 视频 VAE / 音频 VAE
VHS_VideoCombine(VHS 插件) 合成 24fps MP4 并保存 video(IMAGE)+ 可选 audio(AUDIO)

连线关系(一图流)

scss 复制代码
┌─── ① 加载区(三大件)──────────────┐
│  UNETLoader                        │
│  CLIPLoader                        │
│  VAELoader (video)                 │
│  VAELoader (audio)                 │
└────────────────────────────────────┘
              ↓ MODEL
┌─── ② 条件构建 ────────────────────┐
│  MiniMaxH3ImageToVideo             │
│  (prompt, width/height/length)     │
└────────────────────────────────────┘
              ↓ CONDITIONING / LATENT
┌─── ③ 采样 ────────────────────────┐
│  KSampler (20步, cfg=1.0)           │
└────────────────────────────────────┘
              ↓ SAMPLES
┌─── ④ 解码 + 保存 ─────────────────┐
│  VAEDecode ─→ VHS_VideoCombine    │
│  VAEDecodeAudio ─→ (混入音频)      │
└────────────────────────────────────┘

关键采样参数(针对跳舞场景)

参数 说明
cfg (guidance) 1.0 ⚠️ H3 已做 guidance distillation,千万别设 7.5,否则边缘硬化、动作崩坏
steps 20(质量)/ 4-8(Turbo LoRA 加速) 默认 20
sampler / scheduler res_multistep / simple 求快可用 euler / simple
帧数 17n+5 网格对齐,5秒≈124帧 Resolution Selector 自动吸附
分辨率 测试 0.4MP(832×480);成品 1344×768 (16:9) 本地最高 768p 短边;别用 1.0MP(会超 768×1344 像素面积上限)
FPS 24 固定

具体工作流json代码如下:

json 复制代码
{
  "1": {
    "inputs": {
      "unet_name": "minimax_h3_fl2va_pruned_int8_convrot.safetensors",
      "weight_dtype": "default"
    },
    "class_type": "UNETLoader",
    "_meta": {
      "title": "UNet加载器"
    }
  },
  "2": {
    "inputs": {
      "clip_name": "qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors",
      "type": "minimax",
      "device": "default"
    },
    "class_type": "CLIPLoader",
    "_meta": {
      "title": "加载CLIP"
    }
  },
  "3": {
    "inputs": {
      "vae_name": "minimax_h3_video_vae_fp16.safetensors"
    },
    "class_type": "VAELoader",
    "_meta": {
      "title": "加载VAE"
    }
  },
  "4": {
    "inputs": {
      "vae_name": "minimax_h3_audio_vae_fp32.safetensors"
    },
    "class_type": "VAELoader",
    "_meta": {
      "title": "加载VAE"
    }
  },
  "7": {
    "inputs": {
      "prompt": "integrated_multimodal_description: cinematic realism, soft natural light, a young woman in a red velvet long dress, dancing alone in a minimalist white studio. medium-full shot, fixed camera with slight push-in. [Shot 1] 0-2s: facing camera, arms rising slowly to shoulder height, weight shifting right to left, elegant. [Shot 2] 2-4s: a fluid 360-degree pirouette, dress spreading outward, hair flowing, stable landing. [Shot 3] 4-5s: return to start, arms descending from overhead, smile to camera, freeze frame. continuous motion, clear rhythm, no limb deformation, consistent identity costume lighting. overall_soundscape: bare feet soft steps on floor, dress rustling air, synced to spin. non_diegetic_music: lyrical piano ~96BPM, bright melody, clear bass on beat 1, aligned to dance, fade out at end.",
      "width": 1344,
      "height": 768,
      "length": 124,
      "clip": [
        "2",
        0
      ],
      "vae": [
        "3",
        0
      ]
    },
    "class_type": "MiniMaxH3ImageToVideo",
    "_meta": {
      "title": "MiniMax H3 Image to Video"
    }
  },
  "8": {
    "inputs": {
      "seed": 180855514009551,
      "steps": 20,
      "cfg": 1,
      "sampler_name": "res_multistep",
      "scheduler": "simple",
      "denoise": 1,
      "model": [
        "1",
        0
      ],
      "positive": [
        "7",
        0
      ],
      "negative": [
        "7",
        0
      ],
      "latent_image": [
        "7",
        1
      ]
    },
    "class_type": "KSampler",
    "_meta": {
      "title": "K采样器"
    }
  },
  "9": {
    "inputs": {
      "samples": [
        "8",
        0
      ],
      "vae": [
        "3",
        0
      ]
    },
    "class_type": "VAEDecode",
    "_meta": {
      "title": "VAE解码"
    }
  },
  "10": {
    "inputs": {
      "samples": [
        "8",
        0
      ],
      "vae": [
        "4",
        0
      ]
    },
    "class_type": "VAEDecodeAudio",
    "_meta": {
      "title": "VAE解码(音频)"
    }
  },
  "11": {
    "inputs": {
      "frame_rate": 24,
      "loop_count": 0,
      "filename_prefix": "MiniMax_H3/dancing",
      "format": "video/h264-mp4",
      "pix_fmt": "yuv420p",
      "crf": 20,
      "save_metadata": true,
      "trim_to_audio": false,
      "pingpong": false,
      "save_output": true,
      "images": [
        "9",
        0
      ],
      "audio": [
        "10",
        0
      ]
    },
    "class_type": "VHS_VideoCombine",
    "_meta": {
      "title": "Video Combine 🎥🅥🅗🅢"
    }
  }
}

复制上面的代码, 点击ComfyUI画布粘贴即可使用

提示词

采用 H3 官方三段式结构:integrated_multimodal_description / overall_soundscape / non_diegetic_music

跳舞必须写清「分镜 + 动作节拍 + 配乐」,否则只会原地抖动

提示词如下:

erlang 复制代码
integrated_multimodal_description: 写实电影感, 柔和自然光, 一位身穿红色丝绒长裙的年轻女性,
在极简白色舞蹈工作室中央独舞. 中全景, 固定机位轻微推近.
[Shot 1] 0-2秒: 面朝镜头, 双臂由体侧缓缓抬至肩高, 重心由右脚移至左脚, 舒展优雅.
[Shot 2] 2-4秒: 以腰部为轴做一个流畅的360度平转 pirouette, 裙摆随旋转向外展开, 长发轻扬, 落地稳定收束.
[Shot 3] 4-5秒: 回到起始姿态, 双臂由头顶缓缓落下, 面向镜头微笑, 定格结束.
动作连贯, 节奏明确, 肢体无变形, 身份服装光线保持一致.

overall_soundscape: 赤脚踩地板轻微脚步声, 裙摆与空气摩擦细响, 随旋转同步.

non_diegetic_music: 中速约96BPM抒情钢琴曲, 旋律明亮, 每小节第一拍清晰低音, 与舞蹈节拍对齐, 结尾渐弱收束.

如果想要指定人物长相(脸保持一致), 需要把扩散模型由minimax_h3_fl2va_pruned_int8_convrot.safetensors替换成minimax_h3_ref2va_pruned_int8_convrot.safetensors ,并指定参考图

云端生成

视频模型对显卡算力要求比较高, 至少24G显存, 普通电脑完全没法玩, 建议大家使用云端ComfyUI, 比如阿里无影灵构工作站, 每天签到就能领算力, 相当于免费

直接使用现成的镜像包即可:

目前新用户可直接一次性领取200灵豆算力, 可以试试:

如果模型缺失, 还可以上传自定义模型, 通过官方的无影云盘实现本地电脑和云端数据交互:

官网: 点击进入

使用第三方AI平台

目前比较知名的AI视频创作平台有:

  • Tapnow:深圳添科智能 旗下的 AI 原生商业视觉创作引擎
  • Libtv:LiblibAI(哩布哩布 AI)出品的 AI 视频创作平台,无限画布 + Skill 接口,内部集成了市面主流的数十种视频模型
  • Running Hub:基于 ComfyUI 架构的 AI 创作平台,兼容 ComfyUI JSON、预装 7000-9000+ 节点,其实就是云端 ComfyUI
  • 即梦AI:字节的闭源消费级 AI 视频/图像产品
  • Updream :B 站出品的面向 UP 主的AI 视频创作平台
  • Seko: 商汤科技出品的 AI 创编一体短剧/短视频创作 Agent,无限画布 + 创作 Agent + Skill 生态,主打短剧/漫剧/音乐 MV/出海多集连续生产

我们需要明白的是, 视频生成的效果和使用的视频模型有关,和你使用什么平台没有太大关系,这就好比同样是聊天工具,扣扣、微信、抖音,你说哪个聊天更强?它们从技术上其实没有本质区别,全看你个人需求,这些 AI 平台也是同样的道理,选一个自己用的顺手且个人认为性价比高的用就行。

平台的目的只是为了降低大众用户的使用门槛,用户不需要了解具体的底层原理,也无需花时间精力自己搭建调试部署软件下载模型等,只要提供相应的需求以及镜头语言提示词即可进行创作

如果你是程序员或者懂底层原理,强烈建议使用 ComfyUI 自己手搓,更加灵活可控,足以应对未来 AI 变化

如果你只是想快速体验一把文生视频的快感, 那么直接上豆包, 方便快捷, 每天有免费的视频生成额度, 一个账号不够, 那就多开几个账号玩😂, 可以用它练练提示词

效果展示

由于我们在工作流中设置的视频生成总帧数是124, 而帧率是24, 所以总共生成5秒的视频, 如果你想生成15秒, 需要在MiniMaxH3ImageToVideo节点中将总帧数改为362, 并将提示词补充够15秒镜头

15秒的跳舞视频如下:

跳转B站观看效果

上方15秒视频提示词参考:

sql 复制代码
integrated_multimodal_description: 真人电影感, 高对比霓虹夜店美学, 暗调环境光配电光蓝/品红/青绿扫光. [Shot 1] 0-2秒: 低角度广角仰拍, 一位身穿黑色反光夹克的女性DJ在升高DJ台后推推子, 手指在CDJ转盘上快速刮碟, 头戴LED环形耳机, 霓虹管字 "NEON" 在身后脉动. 镜头以中幅快速横移(Truck Right)扫过DJ台, 频闪灯每拍切一次颜色. [Shot 2] 2-4秒: 硬切到舞池全景, 几十名年轻人在135BPM节拍下齐跳, 双手举过头顶交叉摆动, 身体左右晃肩, 有人原地蹦跳, 有人做wave. 相机手持跟拍(Tracking Shot)穿入人群, 小幅快速推进, 激光束从头顶扫过雾机, 镜头边缘有意象光晕与色散. [Shot 3] 4-5秒: 切到人群中景, 一位穿银色吊带短裙的舞者正对镜头甩头顿足, 霓虹在她脸上交替投下蓝/粉光斑, 背景虚化的人海继续跳动. 镜头在最后一拍做轻微慢动作(Roll Counterclockwise小幅)后切回实时, 定格在众人跃起瞬间. 全程人物服装/发型/光线一致, 肢体无变形, 动作与135BPM鼓点严格对齐.

overall_soundscape: 厚底靴踩地闷响, 液体在玻璃杯里晃动, 雾机喷气嘶声, 人群合唱式喊拍"嘿!嘿!", 近距离衣物摩擦与呼吸声, 音箱低频在胸腔共振的体感轰鸣.

non_diegetic_music: 135BPM 商业DJ舞曲, 四四拍底鼓每拍清晰, 副歌前_buildup_用滚奏hi-hat与上升synth riser, drop段重低音bassline+失真lead+紧凑clap, 间奏切到filter sweep与crowd vocal chop, 整体动态从intro克制到drop全频炸开, 结尾留2拍echo尾音.
                                                             
 
 
 
                                                             

由于掘金的限制, 本文图片上传不完全, 更多关于AI相关的内容可以关注公众号《乱码三千》

本文为作者原创 转载时请注明出处 谢谢

ACG作坊-- 分享动漫制作的博客站

相关推荐
Shinomiya1 小时前
最近在学进程调度和环境变量,记点心得
后端
Coder_Ke1 小时前
代码我都定位了,Codex 还在考古:于是我写了个 VS Code 插件
前端
分支预测失败1 小时前
RISC-V 核间中断 IPI 实战:从 MSIP 寄存器到 IMSIC 消息投递
linux·后端
用户850869276151 小时前
Rust系统编程在任务调度中的踩坑与优化之路
后端
LiaCode2 小时前
别让 AI 把仓库写成“代码平行宇宙”:从 Deslop 看生成前查重
前端·后端·github
啵啵啵鱼2 小时前
DS-顺序表
java·数据结构·笔记·后端·链表·obsidian
nice先生的狂想曲2 小时前
javascript高级程序设计(六)——2026.9.5
前端·javascript
回家吃饭去吧2 小时前
AI Agent Function Calling / Tool Use 深度解析
后端
光影少年2 小时前
如何做大型React+RN 项目架构设计、目录规范
前端·react native·react.js