第027章:ComfyUI视频制作LTX-2.3模型(文生视频)

通过前面的文章,我们已经可以通过Z-Image去生成模特图片、通过Qwen3-TTS和Index-TTS2去设计模特音色并生成相应的音频。

现在人物有了、声音也就有了,就差让人物开口讲话,生成视频了。

从今天开始我们将学习一个新的视频模型LTX2.3。

LTX-2.3 是以色列 AI 公司 Lightricks 于 2026 年 3 月发布的开源生产级多模态视频大模型,全称 LTX 2.3 Text-to-Video,是目前综合能力最强的本地可部署开源视频模型之一,在流畅动态、音画同步、细节质感上有明显优势。

可以实现:文生视频、图生视频、音频生视频、参考图 / 参考视频续片。

我们先从最简单的文生视频开始,LTX-2.3模型文生视频支持一次最长20s的视频生成,不过我不建议你一次生成太长,一是太长了容易崩,二是一次生成太长我们普通的显卡也有点扛不住。建议每次生成长度不要超过5s,后期再自己拼接一下。

做视频的话有一个基础知识,是我们必须要理解的,就是"帧率(Frames Per Second)"。

帧率指的是每秒画面帧数,1帧就是1张图片,1 秒的视频里,包含多少张静态图片,数值就是多少帧率。

一个5s时长帧率25FPS的视频,总帧数就是5*25=125FPS。

一般有一下几种帧率设置:

(1)24 FPS(电影标准)适合文艺宣传片、门店慢镜头、产品介绍等。

(2)25 FPS(国内短视频 / 电视标准,LTX2.3 短片段首选)国内抖音、视频号等常用帧率,一般情况我们都用这个帧率。

(3)30 FPS(一般手机实拍标准)画面顺滑度更高,细微运动(茶水蒸汽、飘动窗帘)过渡更细腻,同等时长下总帧数变多,渲染时间更长、显存占用更高。

(4)48/50/60 FPS(高帧率)极致顺滑,适合快速运镜、人物走动,打斗场面等。

帧数越多,AI 计算量越大,生成等待时间越长,对显卡的要求越高!对于我的5060Ti-16G显卡来说,30帧就有些吃力了,基本就是能够到的极限了,再高基本就跑不了了!

下来我们正式开始,LTX2.3视频模型的本地部署,和基础文生视频工作流的搭建。

第一步:启动我们的ComfyUI,如下图所示点击工作台左侧的"模板",这里面有很多ComfyUI官方提供的一些基础工作流。

我们在模板库里搜索"LTX2.3",可以看到里面有"文生视频、图生视频、图像音频转视频"的工作流,今天我们先看"LTX-2.3:文生视频"的工作流。

直接点击"LTX-2.3:文生视频",就会把这个工作流加入到我们的工作台里,可以看到这个工作流特别的简单,总共由三部分。

从左往右分别是:

(1)工作流的一个介绍,里面有模型文件的下载地址,以及在ComfyUI中应该存放的的位置信息。不多大家要注意,这里面给的模型文件的下载地址是Huggingface的地址,我们国内是没有办法直接访问的。

(2)Text to Video (LTX-2.3)组件,这是第三方封装好的LTX2.3 一键文生视频整合节点,把模型加载、文本编码、视频采样、空间超分打包成单节点,不用手动拼接多个原生 LTX 节点,新手直接填参数就能出片。

里面用到了4个加载模型文件的参数,从上到下分别是:

①ckpt_name:这是LTX的主视频模型,fp8 量化版本,显存友好,16G 显存即可运行;完整 FP16 原版需要 24G 以上显存。

②distilled_lora:这是LTX官方提供的蒸馏运动 LoRA,核心作用:提升画面自然动态、减少画面闪烁、抑制物体变形;384 代表适配 384 帧以内短视频

③text_encoder:这就是前面几张我们用的文本编码文件(clip),Ltx用的这个Gemma3 12B文本编码器,是可以支持中文的,输入中文不会报错、能正常跑通生成。但是不建议直接用中文,最好是翻译成英文再输入。

④latent_upscale_model:这里是LTX官方提供的2倍放大模型模型,版本 1.1比老的1.0版本好很多;这个节点的作用是先生成低分辨率潜像,再用该模型放大 2 倍输出高清视频。 比如:我们给的分辨率是 1280x720,模型实际先生成 640x360的低分辨率视频,再放大到目标尺寸,大幅降低生成时显存占用,同时提升画面锐度、纹理细节。

第二步:模型下载,他的官方介绍里给的下载地址都是国外的HuggingFace的地址,正常情况下我们是无法直接访问的,我们需要去国内的魔塔社区里面去下载这些模型文件。

(1)再魔塔里搜索"LTX-2.3",如下图:

这里面我们只下载一个Lora文件"ltx-2.3-22b-distilled-lora-384.safetensors"和一个放大模型文件"ltx-2.3-spatial-upscaler-x2-1.1.safetensors"。

这里面的主模是官方原版的,我的16G显存是跑不动的,24G以上显存的显卡可以尝试一下。

(2)我们16G的显卡,LTX主模型搜索"LTX-2.3-fp8",如下图:

把下图标出的两个都下来,第二个distilled的文件后面会用到。

(3)文本编码文件搜索"gemma_3_12B_it_fp8"。

第三步:模型文件部署,把下载好的文件分别复制到下面的文件夹里,从上到下依次是:

(1)latent_upscale_model文件夹放入"ltx-2.3-spatial-upscaler-x2-1.1.safetensors"。

(2)loras文件夹放入"ltx-2.3-22b-distilled-lora-384.safetensors"。

(3)text_encoders文件夹放入"gemma_3_12B_it_fp8_scaled.safetensors"。

(4)checkpoints文件夹放入主模型(如下图),大家可以看到,我多下载了一个nvfp4的版本,这个版本是50系显卡的专用模型文件,都说效果只比fp8的版本差一丢丢,单速度提升了很多。不过我自己是下来,速度的确提升了很多,单效果差很多,也可能是我还不会用,就先放着。

第四步:重新启动ComfyUI,如果你向我一样,在复制文件的时候由套了一层文件夹,那么你进到工作流以后就需要把4个文件的路径分别重新选择一下。

到此LTX-2.3文生视频的工作流就搭好了,可以开始尝试了。

如果你也是跟我一样用的50系列的显卡,想尝试一下nvfp4版本的模型文件,那下载后直接在组件里切换就行了,剩下的都不用动(如下图)。

下面是我生成的视频,大家可以看到nvfp4版本的模型文件确实是快,基本都是150s左右。而普通的fp8版本基本都在210s左右,不过你自己试一下看看效果就知道了,效果差的有点多。

---------结束线---------

至此我们的LTX-2.3模型的部署,以及文生视频的工作流搭建就完成了,下一章开始我们就去实现图生视频的工作流搭建。

我建了一个群,方便大家在学习的过程中相互交流。有兴趣的朋友可以加一下,平时也会在群里分享一些资料。

如果大家在阅读文章的时候有什么困惑,可以在文章的底部留言,我看到的第一时间就会进行回复。

再一个也可以在赞赏文章后,针对所赞赏文章的内容,有不明白的地方,可以和我约个时间,进行一对一的实时交流,赞赏金额不限制,多少都可以!

相关推荐
DogDaoDao3 小时前
深度学习增强的视频压缩框架:Neutron Star 如何超越 VVC
人工智能·深度学习·音视频·视频编解码·h266·vvc·视频压缩
byte轻骑兵3 小时前
蓝牙PBP公共广播协议:解锁LE Audio的公共音频新生态
音视频·蓝牙·蓝牙耳机·le audio·低功耗蓝牙音频
AI创界者3 小时前
【8G显存福音】最新LTX-2.3-22B-DISTILLED-1.1-VBVR 整合包文生视频、图生视频,支持首尾帧/单图无限时长,50系显卡全适配!
人工智能·音视频
桐桐桐4 小时前
按目标大小压缩视频:码率反推公式、H.264/H.265 实测与 FFmpeg 自动化
音视频·h.265·h.264
阿童木写作4 小时前
TikTok Shop视频翻译工具实战测评
人工智能·python·音视频
神奇霸王龙5 小时前
跨厂商大模型接入实战:5大基座性能对比
人工智能·ai·aigc·dubbo·claude·qwen·ai金融
DogDaoDao5 小时前
【论文解读】系数能量引导的快速变换算法:Beyond VVC 编码器优化新思路
音视频·视频编解码·ecm·h266·vvc·变换编码·beyond vvc
美港探案5 小时前
MiniMax H3 炸场!视频大模型拼“真实生产”时代到来
音视频
VIP_CQCRE14 小时前
用 Ace Data Cloud 接入 Suno 声音克隆 API:让 AI 音乐生成拥有专属人声
aigc·api·suno·ai音乐·ace data cloud
AI创界者19 小时前
AIGC进阶】Sulphur-2 视频生成大模型离线实战:文生视频/图生视频本地一键部署整合包解压即用与调优指南
人工智能·aigc·音视频