LatentSync数字人,一键批量,口型同步,MPS加速(WIN/MAC)

分享一个最近还不错的数字人项目------LatentSync。该项目由字节开源,上传一段音频和视频,即可生成数字人视频。

我对该项目做了些更改,增加了批量和MAC版本的支持,用MAC的小伙伴再也不用遗憾了...

看下我生成的效果。

https://live.csdn.net/v/460345

简单介绍下如何使用

上传一段人物视频和你要生成人物说话的音频。

点击处理视频等待视频生成

https://live.csdn.net/v/460346

批量模式的使用也相同,支持上传多个文件。

批量模式下音频数量一定要和视频数量保持一致,如果缺少是会报错的。

配置需求

WIN

WindowsN卡需8G显存

如果整合包运行报错,需要安装cuda12.4

https://developer.nvidia.com/cuda-12-4-0-download-archive

MAC

MAC Apple Silicon M1/M2/M3/M4 芯片

8G内存

这里MAC用户需注意📢

针对MAC版本我增加了运行模式,两者的区别在于所需要的内存、处理的速度不同。

默认是cpu执行,考虑到有低内存的小伙伴,该模式下8G内存就能跑,但是速度较慢。

MPS针对16G内存以及以上小伙伴,推荐选择该模式,可以达到一个较快的处理速度。

一些问题

该项目目前只在英文数据集上训练过,所以中文效果比较差,但是还是可以用的,没到完全不能看的地步。

关于中文效果不好,可以通过使用中文数据集来训练解决。目前syncnet可以在4090显卡上进行训练,unet则需要50G显存...

别的没啥啦,简单、好用。干就完事了!

整合包获取

👇🏻👇🏻👇🏻下方下方下方👇🏻👇🏻👇🏻

夸夸夸盘:

https://pan.quark.cn/s/90d2784bc502

度度度盘:

https://pan.baidu.com/s/1HwN1k6v-975uLfI0d8N_zQ?pwd=gewd

制作不易,如果本文对您有帮助,还请点个免费的赞或在看!感谢您的阅读!

相关推荐
工藤学编程13 分钟前
零基础学AI大模型之AI大模型常见概念
人工智能
ACEEE122215 分钟前
Stanford CS336 | Assignment 2 - FlashAttention-v2 Pytorch & Triotn实现
人工智能·pytorch·python·深度学习·机器学习·nlp·transformer
金井PRATHAMA1 小时前
认知语义学中的象似性对人工智能自然语言处理深层语义分析的影响与启示
人工智能·自然语言处理·知识图谱
陈敬雷-充电了么-CEO兼CTO1 小时前
突破多模态极限!InstructBLIP携指令微调革新视觉语言模型,X-InstructBLIP实现跨模态推理新高度
人工智能·自然语言处理·chatgpt·blip·clip·多模态大模型·gpt-5
Jagger_1 小时前
用AI偷懒:我做了个一键切换网络的工具
aigc·ai编程
倔强青铜三1 小时前
最强Python Web框架到底是谁?
人工智能·python·面试
倔强青铜三1 小时前
苦练Python第45天:使用open函数读取文件内容
人工智能·python·面试
倔强青铜三1 小时前
苦练Python第43天:datetime和calendar模块的使用
人工智能·python·面试
倔强青铜三1 小时前
苦练Python第44天:math、random、statistics三剑客,带你秒杀数学计算与数据分析
人工智能·python·面试
buddy_red1 小时前
Knox工具调用功能测试
人工智能·后端·程序员