seedance2.0做的视频太贵?开源免费最佳替代方案:bernini生视频,ltx2.3来配音

最近折腾AI视频这块的人应该都有感觉,付费工具一个月下来花的钱不少,生成次数还老是不够用。这两天翻了不少论坛和B站评论区,发现字节跳动开源的Bernini和Lightricks开源的LTX-2.3被提到的次数越来越多,很多人说这套组合基本能替代掉大部分付费视频生成工具了。这篇文章就把这两个东西捋一遍,包括它们是什么、硬件要求多高、跟同类比怎么样,还有怎么装。

模型文件:https://pan.quark.cn/s/8128d3255a6c

Bernini是什么

Bernini是字节跳动商业化技术团队放出来的一个视频生成和编辑框架,用的是Apache 2.0协议,代码和权重都在GitHub和Hugging Face上挂着,随便下。它跟以前那种"输入文字出一段视频"的工具不太一样,官方论文里管它叫"语义规划+渲染"两段式架构:前面用一个基于Qwen2.5-VL的多模态大模型去理解你要干嘛,后面再用基于Wan2.2的渲染器把画面做出来。

这套设计带来的好处是编辑能力特别强。有UP主在视频里测过换人物、换背景、去字幕、往视频里插广告牌这些操作,说效果比想象中稳,主体不会跑偏,没编辑的部分也基本不会跟着变。知乎上有个回答者提到,Bernini的接口传的是语义信息而不是像素信息,所以理解模块和生成模块可以分开训练,这样两边各自的预训练能力都能保留下来,不会因为联合训练互相拖累。

它能接收的输入也比较多,文字、参考图(最多5张)、参考视频、要编辑的源视频都能一起丢进去。比如你想把视频里人物的衣服换掉,或者把天气从晴天改成下雨,一句话就能搞定,还能保证光照、路面反光这些细节跟着一起变,不是简单加个滤镜。

LTX-2.3是什么

LTX-2.3是Lightricks(做过Facetune、Videoleap这些App的公司)今年放出来的音视频生成模型,同样Apache 2.0开源,允许商用。跟Bernini主要做视频不同,LTX-2.3的卖点是"视频和音频一起生成",不用先出画面再另外配音效或者对口型。参数量大概在190亿到220亿之间(不同资料说法略有出入),其中一部分专门用来处理音频。

配音这块具体表现在哪呢,官方说法是模型训练时专门处理过静音段和噪声,还换了新的声码器,24kHz立体声输出,音画对齐会紧一些,不会出现明显的滞后或者破音。之前LTX-2那一代确实有人反馈音频容易失真,2.3这版基本把这个问题解决了,社区那边测过人物说话场景,口型和声音对得上,不用后期再单独调。

竖屏这块也补上了,之前很多开源视频模型只支持横屏,裁一下就变形,LTX-2.3是拿竖屏数据单独训的,直接出9:16,短视频平台能直接用。分辨率最高能到4K,单次生成时长大概20秒左右,帧率有24/25/48/50几种可以选。

硬件要求怎么样

这块可能是大家最关心的,毕竟不是谁家里都摆着H100。

Bernini这边比较吃硬件,官方文档写的是要Hopper架构的显卡(H100/H800/H200这类),而且是多卡配置,个人电脑基本跑不动完整版。不过B站有UP主提到,如果用社区做的量化或者蒸馏版本,16G显存的卡也能玩起来,只是效果和速度会打折扣。想图省事的话,也有第三方把Bernini搬到云端做成网页版,不用自己配环境。

LTX-2.3相对亲民一点。官方和社区整合包给出的门槛是8GB显存起步,推荐12GB以上,内存建议16GB,硬盘留出50GB左右装模型。RTX 3060这个级别的卡就能跑蒸馏版,追求4K效果的话用RTX 4090这种会顺畅很多。有人在论坛里说自己用的是8G显存的老卡,跑DISTILLED版本文生视频没问题,就是速度会慢一些,一个20秒1080p视频大概要一两分钟。

跟同类工具对比一下

先看视频生成和编辑这块:

对比项 Bernini Runway Gen-3 可灵Kling 即梦
是否开源 是,Apache 2.0
是否收费 免费(自建需硬件成本) 按次/订阅收费 按次/订阅收费 按次/订阅收费
视频编辑能力 强,支持局部编辑、主体替换 有编辑功能,偏商业化打磨 侧重生成,编辑较弱 侧重生成,编辑较弱
多参考图输入 支持最多5张 有限支持 有限支持 有限支持
本地部署 可以,但硬件门槛高 不可以 不可以 不可以
画面细节稳定性 官方评测接近头部闭源模型 成熟稳定 成熟稳定 成熟稳定

再看配音/音频生成这块:

对比项 LTX-2.3 ElevenLabs CosyVoice 剪映自带配音
是否开源 是,Apache 2.0
音画同步生成 支持,视频音频同一次推理出 不涉及视频 不涉及视频 需手动对轨
本地部署 支持,8GB显存起步 不支持 支持 不支持
竖屏原生支持 支持9:16 不涉及 不涉及 支持但需手动调整
环境音/音效生成 支持自动生成 不支持 不支持 不支持
商用授权 免费商用 付费订阅 免费 剪映会员相关限制

从表里能看出来,Bernini的优势在"编辑"这个方向,尤其是那种要改局部、保留其他部分不变的场景;LTX-2.3的优势是省了配音这道工序,画面和声音是一起出来的,不用再找配音工具对轨道。两个搭配起来用,基本能覆盖从生成到出成片的大部分流程。

安装教程

Bernini安装(本地多卡环境)

  1. 先确认显卡是Hopper架构(H100/H800/H200),普通消费卡建议直接用量化版或者网页版,硬来容易报错。

  2. 下载模型文件:https://pan.quark.cn/s/8128d3255a6c

  3. 环境要求Python 3.11.2,CUDA 12.4以上,装之前先检查一下版本对不对,版本不对经常是报错的根源。

  4. 用torchrun跑多卡推理脚本,指定好配置文件和测试用例的json路径就能开始生成。

  5. 想省事的话可以配一下提示词增强,接一个OpenAI兼容的API端点,生成质量会更稳一点。

如果没有多卡环境,也可以走ComfyUI这条路,社区已经有人做了Bernini的节点支持,模型文件在Kijai维护的仓库里能下到,工作流基本上是Wan2.2那套加载区,改一下模型换成Bernini的高低噪版本就行,通常还会配一个4步加速LoRA提速。

LTX-2.3安装(ComfyUI本地部署,8GB显存也能跑)

  1. 先装好ComfyUI,没装过的话去官方仓库拉最新版,Python建议3.10或以上。
  2. 装LTX-2.3官方发布的原生节点插件,ComfyUI的插件管理器里搜一下LTXVideo相关的节点包,装上。
  3. 去Hugging Face或者国内的镜像站下载模型权重,8G显存的话选DISTILLED蒸馏版,文件小一些,占显存也少。
  4. 模型文件下载完放到ComfyUI的models目录里对应的子文件夹,路径不对的话节点会加载不出来。
  5. 导入官方给的示例工作流json文件,里面已经把加载、采样、解码这些节点连好了,改改分辨率和帧数的参数就能用。
  6. 采样步数一般设在22到26步之间,CFG值控制在3.0到5.0,负提示词写清楚能减少画面崩坏的情况。
  7. 想再省显存可以开FP8量化,官方说这样能让体积缩小三成左右,在消费级显卡上推理速度能提升接近一倍。
  8. 生成完在浏览器localhost对应端口预览,如果打不开,检查一下防火墙设置或者换个端口试试。

装的过程中最容易卡住的地方是路径问题和依赖版本冲突,网上教程一般会提醒把安装目录放在非中文路径下,也别装在带空格的文件夹里,能省不少排查时间。

这套组合下来,前期花点时间配环境,配好之后基本就是一次性投入,跟按月付费的工具比,长期用下来省的钱不算少,尤其是产量比较大的自媒体账号,一个月省下来的订阅费可能都够换张显卡了。

相关推荐
AI星桥小王子3 小时前
镜头、角色、剧情自由把控,可控式 AI 视频工作台横向测评
人工智能·音视频
EasyDSS3 小时前
巡逻调度、应急呼叫、多路同屏——企业级融媒体平台EasyDSS一站式搞定园区安保所有音视频需求
音视频·媒体
hz567893 小时前
应急管理部门跨部门会商用什么系统?指挥调度视频会议方案解析
网络·安全·音视频·实时音视频·信息与通信
人工智能研究所5 小时前
ResearchStudio-Reel: 学术论文到海报、视频、博客的“最后一公里“
人工智能·microsoft·音视频·博客·ppt·学术论文·ai创作
声讯电子6 小时前
AU-60 全功能语音处理模组:一款“万能接入”的AI音频前端方案解析
人工智能·音视频·语音识别·ai降噪·usb接口·回音消除
xingxiliang16 小时前
深入浅出 Android CTS 视频测试:从环境搭建、用例设计到底层通信原理
android·音视频
hz5678921 小时前
私有云会议系统选型攻略:企业级安全与高效协同并行
安全·音视频·实时音视频·信息与通信
Yeauty21 小时前
渲染成图再 CLI 拼接,还是进程内直推?Rust 帧到视频的两条路
开发语言·rust·音视频
达子6661 天前
第13章_HarmonyOs开发图解 视频
华为·音视频·harmonyos