HunyuanVideo-Foley V2版 - AI视频配音 自动识别视频内容并配音 支持50系显卡 一键整合包下载

HunyuanVideo-Foley 是腾讯开源的一款 AI视频配音工具,可以自动理解视频内容,并为其配上生成逼真的音效,让画面和声音完美同步。它的目标是帮助视频创作者快速获得高质量的背景声、动作声和环境音,而不用再手工录制或后期合成。

HunyuanVideo-Foley 就像一个"AI 音效师",能自动为视频生成高质量、同步的音效,特别适合短视频、影视、广告和游戏制作。它降低了创作者的门槛,让专业级音效更容易获得。

今天分享的 HunyuanVideo-Foley V2版,和上个版本不同的是对硬件要求更低,上个版本需要最少16G显存 运行,而V2版更适合消费级显卡使用,最小只需要6G显存即可运行,我在ComfyUI工作流的基础上制作了更适合小白使用WebUI,需要更多功能设置的专业用户,可以使用ComfyUI模式。

下载地址: 点此下载

核心特点

自动生成音效:只需输入视频和简单的文字描述,模型就能生成与画面动作匹配的声音,比如脚步声、关门声、雨声等。

多模态理解:它不仅看视频,还能结合文字提示,确保生成的声音既符合画面,又符合语义。

高保真音质:支持 48kHz Hi-Fi 输出,声音清晰度达到专业级别,可直接用于影视或游戏。

精准同步:采用专门的同步算法(Synchformer),保证声音和视频动作在时间上对齐,不会出现"嘴型对不上声音"的问题。

应用领域

短视频创作:博主或自媒体可以快速给视频加上真实音效,提高观感。

影视后期:电影、电视剧制作中,用来生成环境音或动作音效,节省人工录音成本。

广告创意:广告片中需要快速匹配音效,AI 可以自动生成,提升效率。

游戏开发:为游戏场景生成沉浸式音效,增强玩家体验。

教育与研究:作为多模态 AI 的研究工具,用于探索视频、文本和音频的结合。

使用教程: (建议N卡,显存8G起,支持50系显卡)

下载主程序和模型(ComfyUI文件夹),解压主程序一键包,将ComfyUI文件夹移动到主程序目录下即可

上传需要配音的无声视频,设置参数,比如生成视频宽度,生成音频时长等,生成即可。

软件目录结构:

📂 ComfyUI/

├── 📂 models/

│ ├── 📂 foley/

│ └── hunyuanvideo_foley_fp8_e4m3fn.safetensors

│ └── vae_128d_48k_fp16.safetensors

│ └── synchformer_state_dict_fp16.safetensors

📂 deepface/

......

相关推荐
徐小夕@趣谈前端4 小时前
拒绝重复造轮子?我们偏偏花365天,用Vue3写了款AI协同的Word编辑器
人工智能·编辑器·word
阿里云大数据AI技术4 小时前
全模态、多引擎、一体化,阿里云DLF3.0构建Data+AI驱动的智能湖仓平台
人工智能·阿里云·云计算
陈天伟教授4 小时前
人工智能应用- 语言理解:05.大语言模型
人工智能·语言模型·自然语言处理
池央4 小时前
CANN GE 深度解析:图编译器的核心优化策略、执行流调度与模型下沉技术原理
人工智能·ci/cd·自动化
七月稻草人4 小时前
CANN ops-nn:AIGC底层神经网络算力的核心优化引擎
人工智能·神经网络·aigc·cann
种时光的人4 小时前
CANN仓库核心解读:ops-nn打造AIGC模型的神经网络算子核心支撑
人工智能·神经网络·aigc
晚霞的不甘4 小时前
守护智能边界:CANN 的 AI 安全机制深度解析
人工智能·安全·语言模型·自然语言处理·前端框架
谢璞4 小时前
中国AI最疯狂的一周:50亿金元肉搏,争夺未来的突围之战
人工智能
池央4 小时前
CANN 算子生态的深度演进:稀疏计算支持与 PyPTO 范式的抽象层级
运维·人工智能·信号处理
方见华Richard4 小时前
世毫九实验室(Shardy Lab)研究成果清单(2025版)
人工智能·经验分享·交互·原型模式·空间计算