最近折腾AI视频这块的人应该都有感觉,付费工具一个月下来花的钱不少,生成次数还老是不够用。这两天翻了不少论坛和B站评论区,发现字节跳动开源的Bernini和Lightricks开源的LTX-2.3被提到的次数越来越多,很多人说这套组合基本能替代掉大部分付费视频生成工具了。这篇文章就把这两个东西捋一遍,包括它们是什么、硬件要求多高、跟同类比怎么样,还有怎么装。
模型文件:https://pan.quark.cn/s/8128d3255a6c

Bernini是什么
Bernini是字节跳动商业化技术团队放出来的一个视频生成和编辑框架,用的是Apache 2.0协议,代码和权重都在GitHub和Hugging Face上挂着,随便下。它跟以前那种"输入文字出一段视频"的工具不太一样,官方论文里管它叫"语义规划+渲染"两段式架构:前面用一个基于Qwen2.5-VL的多模态大模型去理解你要干嘛,后面再用基于Wan2.2的渲染器把画面做出来。
这套设计带来的好处是编辑能力特别强。有UP主在视频里测过换人物、换背景、去字幕、往视频里插广告牌这些操作,说效果比想象中稳,主体不会跑偏,没编辑的部分也基本不会跟着变。知乎上有个回答者提到,Bernini的接口传的是语义信息而不是像素信息,所以理解模块和生成模块可以分开训练,这样两边各自的预训练能力都能保留下来,不会因为联合训练互相拖累。
它能接收的输入也比较多,文字、参考图(最多5张)、参考视频、要编辑的源视频都能一起丢进去。比如你想把视频里人物的衣服换掉,或者把天气从晴天改成下雨,一句话就能搞定,还能保证光照、路面反光这些细节跟着一起变,不是简单加个滤镜。
LTX-2.3是什么
LTX-2.3是Lightricks(做过Facetune、Videoleap这些App的公司)今年放出来的音视频生成模型,同样Apache 2.0开源,允许商用。跟Bernini主要做视频不同,LTX-2.3的卖点是"视频和音频一起生成",不用先出画面再另外配音效或者对口型。参数量大概在190亿到220亿之间(不同资料说法略有出入),其中一部分专门用来处理音频。
配音这块具体表现在哪呢,官方说法是模型训练时专门处理过静音段和噪声,还换了新的声码器,24kHz立体声输出,音画对齐会紧一些,不会出现明显的滞后或者破音。之前LTX-2那一代确实有人反馈音频容易失真,2.3这版基本把这个问题解决了,社区那边测过人物说话场景,口型和声音对得上,不用后期再单独调。
竖屏这块也补上了,之前很多开源视频模型只支持横屏,裁一下就变形,LTX-2.3是拿竖屏数据单独训的,直接出9:16,短视频平台能直接用。分辨率最高能到4K,单次生成时长大概20秒左右,帧率有24/25/48/50几种可以选。
硬件要求怎么样
这块可能是大家最关心的,毕竟不是谁家里都摆着H100。
Bernini这边比较吃硬件,官方文档写的是要Hopper架构的显卡(H100/H800/H200这类),而且是多卡配置,个人电脑基本跑不动完整版。不过B站有UP主提到,如果用社区做的量化或者蒸馏版本,16G显存的卡也能玩起来,只是效果和速度会打折扣。想图省事的话,也有第三方把Bernini搬到云端做成网页版,不用自己配环境。
LTX-2.3相对亲民一点。官方和社区整合包给出的门槛是8GB显存起步,推荐12GB以上,内存建议16GB,硬盘留出50GB左右装模型。RTX 3060这个级别的卡就能跑蒸馏版,追求4K效果的话用RTX 4090这种会顺畅很多。有人在论坛里说自己用的是8G显存的老卡,跑DISTILLED版本文生视频没问题,就是速度会慢一些,一个20秒1080p视频大概要一两分钟。
跟同类工具对比一下
先看视频生成和编辑这块:
| 对比项 | Bernini | Runway Gen-3 | 可灵Kling | 即梦 |
|---|---|---|---|---|
| 是否开源 | 是,Apache 2.0 | 否 | 否 | 否 |
| 是否收费 | 免费(自建需硬件成本) | 按次/订阅收费 | 按次/订阅收费 | 按次/订阅收费 |
| 视频编辑能力 | 强,支持局部编辑、主体替换 | 有编辑功能,偏商业化打磨 | 侧重生成,编辑较弱 | 侧重生成,编辑较弱 |
| 多参考图输入 | 支持最多5张 | 有限支持 | 有限支持 | 有限支持 |
| 本地部署 | 可以,但硬件门槛高 | 不可以 | 不可以 | 不可以 |
| 画面细节稳定性 | 官方评测接近头部闭源模型 | 成熟稳定 | 成熟稳定 | 成熟稳定 |
再看配音/音频生成这块:
| 对比项 | LTX-2.3 | ElevenLabs | CosyVoice | 剪映自带配音 |
|---|---|---|---|---|
| 是否开源 | 是,Apache 2.0 | 否 | 是 | 否 |
| 音画同步生成 | 支持,视频音频同一次推理出 | 不涉及视频 | 不涉及视频 | 需手动对轨 |
| 本地部署 | 支持,8GB显存起步 | 不支持 | 支持 | 不支持 |
| 竖屏原生支持 | 支持9:16 | 不涉及 | 不涉及 | 支持但需手动调整 |
| 环境音/音效生成 | 支持自动生成 | 不支持 | 不支持 | 不支持 |
| 商用授权 | 免费商用 | 付费订阅 | 免费 | 剪映会员相关限制 |
从表里能看出来,Bernini的优势在"编辑"这个方向,尤其是那种要改局部、保留其他部分不变的场景;LTX-2.3的优势是省了配音这道工序,画面和声音是一起出来的,不用再找配音工具对轨道。两个搭配起来用,基本能覆盖从生成到出成片的大部分流程。
安装教程
Bernini安装(本地多卡环境)
-
先确认显卡是Hopper架构(H100/H800/H200),普通消费卡建议直接用量化版或者网页版,硬来容易报错。
-
环境要求Python 3.11.2,CUDA 12.4以上,装之前先检查一下版本对不对,版本不对经常是报错的根源。
-
用torchrun跑多卡推理脚本,指定好配置文件和测试用例的json路径就能开始生成。
-
想省事的话可以配一下提示词增强,接一个OpenAI兼容的API端点,生成质量会更稳一点。
如果没有多卡环境,也可以走ComfyUI这条路,社区已经有人做了Bernini的节点支持,模型文件在Kijai维护的仓库里能下到,工作流基本上是Wan2.2那套加载区,改一下模型换成Bernini的高低噪版本就行,通常还会配一个4步加速LoRA提速。
LTX-2.3安装(ComfyUI本地部署,8GB显存也能跑)
- 先装好ComfyUI,没装过的话去官方仓库拉最新版,Python建议3.10或以上。
- 装LTX-2.3官方发布的原生节点插件,ComfyUI的插件管理器里搜一下LTXVideo相关的节点包,装上。
- 去Hugging Face或者国内的镜像站下载模型权重,8G显存的话选DISTILLED蒸馏版,文件小一些,占显存也少。
- 模型文件下载完放到ComfyUI的models目录里对应的子文件夹,路径不对的话节点会加载不出来。
- 导入官方给的示例工作流json文件,里面已经把加载、采样、解码这些节点连好了,改改分辨率和帧数的参数就能用。
- 采样步数一般设在22到26步之间,CFG值控制在3.0到5.0,负提示词写清楚能减少画面崩坏的情况。
- 想再省显存可以开FP8量化,官方说这样能让体积缩小三成左右,在消费级显卡上推理速度能提升接近一倍。
- 生成完在浏览器localhost对应端口预览,如果打不开,检查一下防火墙设置或者换个端口试试。
装的过程中最容易卡住的地方是路径问题和依赖版本冲突,网上教程一般会提醒把安装目录放在非中文路径下,也别装在带空格的文件夹里,能省不少排查时间。
这套组合下来,前期花点时间配环境,配好之后基本就是一次性投入,跟按月付费的工具比,长期用下来省的钱不算少,尤其是产量比较大的自媒体账号,一个月省下来的订阅费可能都够换张显卡了。