正面硬刚 Seedance 2.5, 开源视频模型:LTX-2.5 用 6.8 秒生成 10 秒视频

生成 10 秒视频只需 6.8 秒。比实时还快。还开源。

这不是广告语,这是 Lightricks 旗下 LTX 正式发布 LTX-2.5 时的数据。这一次,开源阵营真的打到了闭源大模型的腹地。

01|这家公司是谁?

PART| Lightricks老牌视频公司

很多人不知道,Lightricks 是以色列的一家老牌消费级图像/视频编辑应用公司,旗下有 Facetune、Videoleap 等产品,在 AI 浪潮之前就是一家盈利的软件公司。

2022 年,他们开始转型做基础模型,2024 年推出了第一个开源视频模型 LTX Video (仅 2B 参数)。此后一路狂奔:2025 年 5 月升级到 13B,同年 10 月推出 LTX-2 ,2026 年 3 月推出 LTX-2.3 ,再到今天的 LTX-2.5

LTX 的整个模型家族已超过 3300 万次下载,是目前市场上下载量最高的开放世界模型系列。

02|这家公司是谁?LTX-2.5 核心参数

PART| 核心参数一览表

LTX-2.5 是建立在 22B 参数非对称双流扩散 Transformer 上的音视频基础模型,通过双向音视频交叉注意力机制与模态感知无分类器引导,联合生成视频与音频。</cite>

03|最重磅的新特征

PART| 核心特征拆解

1. Diffusion Fidelity Rendering(扩散保真渲染)

这是 LTX-2.5 最核心的技术创新,也是官方命名的全新渲染体系。

核心思路是:按场景复杂度动态分配渲染算力。复杂场景多用算力,简单场景不浪费资源,最终实现「每一帧都对得上大银幕」的画面精度。

LTX-2.5 采用的 Diffusion Fidelity Rendering 流程,根据场景复杂度分配渲染算力。

与此同时,旧版的 VAE 解码器被全新的扩散视频解码器取代------这意味着面部细节更清晰、纹理更稳定、运动更自然、伪影更少。

2. 原生多镜头(Native Multishot)

这是目前开源模型里最稀缺的能力之一:在单次生成中产出多个衔接镜头,角色形象、环境、光线、声音全程一致

多镜头生成在整个剪辑场景中保持角色形象、光线和视觉风格的一致性,非常适合需要多个镜头衔接的企业视频、产品演示和营销内容。

以往做多镜头视频,要么用户手动缝合,要么祈祷每段单独生成的视频里角色脸不变形。LTX-2.5 一次生成全搞定,这对视频创作者来说意义极大。

3. 更强的提示词理解(Gemma 4 12B 文本编码器)

LTX-2.5 把文本编码器换成了定制版 Gemma 4 12B,并配合专属提示词增强器(Prompt Enhancer)。

效果是什么?该模型能在整段复杂提示词中保留多个主体、动作、光线和摄像机方向,而提示词增强器则能将简短描述扩展成更详细的电影级指令。

简单说:你写一个人走过街道,模型会自动理解并扩展为具有光影、镜头运动、环境氛围的完整创作指令。

4. 自动时长预测(Auto Duration)

以往生成视频需要手动指定帧数,LTX-2.5 加入了时长预测头:模型根据你描述的动作内容,在扩散开始之前自动判断应该生成多长的片段。

不再需要反复调参猜帧数,「跑步穿过森林」和「慢慢回头看一眼」自然生成不同时长。

5. 同步音频生成

音频不是后期配的,而是和视频联合生成的。对话、环境音、音效,自动匹配视频内容的情绪和节奏。

统一的音视频生成意味着声音、背景音和拟音自动匹配视觉内容的情绪和节奏,无需单独的音频后期工作流程。

6. 原生 4K HDR + RAW 工作流

最高支持原生 4K HDR 输出,同时支持 EXR 格式的 RAW 工作流------这意味着可以直接接入专业调色和后期流水线,不破坏母版。

04|模型速度对比

PART| 快到什么程度?

官方数据:LTX-2.5 在自建环境(2×GB200)以稳定状态运行,生成一个 10 秒 720p 图生视频片段仅需 6.8 秒

这意味着比视频实时播放还要快。把这个数字放到同类模型的对比里:

当然,这里需要说明:6.8 秒是 LTX 自建环境的测试数据 ,普通开发者用 API 是 23.7 秒,仍是对比列表中最快的。但即使是 23.7 秒,也比 Seedance 2.5 的 317 秒快了 13 倍以上

05|模型画质对比

PART| 伪影更少了

官方公布了一项文生视频的伪影数量评测(98 个相同提示词、10 个模型、自动评分):

LTX-2.5 Pro 在伪影评分上排名第一,伪影计算包括污点、破碎纹理、融化或涂抹区域。结果为初步数据,评测范围扩大后预计会持续更新。

06|模型全面对比

PART| 与主要闭源模型对比

LTX-2.5 vs Seedance 2.5

这是被问最多的问题。两者代表了当下最高水准的开源与闭源方向。

LTX 的开放权重允许更高分辨率,而 Seedance 2.5 即使在托管平台上也只能达到 720p。

一句话总结: Seedance 2.5 的闭源方案在角色一致性和提示词精准度上仍有优势,但 LTX-2.5 在速度、分辨率、开放性、成本上全面领先,且伪影更少。

LTX-2.5 vs MiniMax H3

MiniMax H3 是「有条件开放」,在美国、欧盟、英国、韩国不可用,生成同一片段需 180 秒,且有强制品牌显示要求。LTX-2.5 无地区限制,无强制品牌,可完全自建部署。

LTX-2.5 vs Kling 3.0 Pro / Veo 3.1

都是闭源 API,无法本地部署,无法微调,生成速度(Kling 398 秒、Veo 70 秒)对比 LTX 均不占优。

07|模型开源的真实价值

PART| 你能拿它做什么?

Lightricks CEO Zeev Farbman 和 ComfyUI 联合创始人 Yoland Yan 都押注开放权重的路线,而非闭源。

对开发者和创业者来说,开源意味着:

可自建,零边际成本:一旦跑在自己的 GPU 上,生成不额外收费,规模越大越省钱。

可微调:用自己的数据和 IP 训练,打造专属风格。官方同时提供 LTX Trainer 工具,社区已有大量 LoRA 开放共享,包括:

  • 唇形同步 LoRA

  • 360° 全景视频 LoRA

  • 任意运动轨迹控制 LoRA

  • 视频超分 LoRA

  • 无缝扩展(Outpainting)LoRA

无数据泄露风险:敏感内容、品牌 IP、客户素材都在本地处理,不出局域网。

无平台绑定:不依赖任何云厂商,可部署在本地、私有云、边缘设备。

08|模型快速上手

PART| 几行代码,本地跑

方式一:在线体验(0 成本)

复制代码
直接打开 https://app.ltx.io 或 HuggingFace Space,无需安装。

方式二:ComfyUI 本地部署

LTX-2.5 首日就原生支持 ComfyUI,官方提供了完整的工作流模板。

复制代码
...json

{

# 第一步:下载模型权重(需先在 HuggingFace 申请访问权限)

hf auth login

hf download Lightricks/LTX-2.5 \

diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \

text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \

vae/ltx-2.5-video-vae-bf16.safetensors \

vae/ltx-2.5-audio-vae-bf16.safetensors \

model_patches/ltx-2.5-duration-head-bf16.safetensors \

--local-dir models/ltx-2.5}

加载到 ComfyUI 后,导入官方提供的 JSON 工作流即可开跑。

方式三:Python 代码调用09|模型局限性

PART| 模型的主要缺点

复制代码
...json

{

from ltx_pipelines.distilled import DistilledPipeline

from ltx_pipelines.utils.model_paths import ModelPaths

model_paths = ModelPaths.from_split(

transformer_path="models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors",

text_encoder_path="models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors",

video_vae_path="models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors",

audio_vae_path="models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors",

)

pipeline = DistilledPipeline(model_paths)

output = pipeline.generate(

prompt="夕阳下,一只金毛猎犬在草原上奔跑,电影级光线",

num_frames=121, # 帧数必须满足 frames % 8 == 1

seed=42)}

在客观性上,有几点值得如实说:

显存要求不低:全量 22B 模型对显存要求较高,推荐使用蒸馏版 + fp8 量化 + CPU Offload 组合降低门槛,但高分辨率长视频仍需现代 GPU。

帧数有限制:帧数必须满足 frames % 8 == 1(如 121、129、137),不够灵活。

多镜头功能:对于极端光线变化或复杂摄像机运动,跨镜头一致性仍可能出现问题。

$1000万以上商用需谈判:年收入超过 1000 万美元的企业需要单独签商业协议。

10|总结

PART| 模型开源已经够用了

LTX-2.5 这次的发布,某种程度上打破了「开源效果差、部署麻烦」的旧印象:

  • 速度

    :API 最快,自建超越实时

  • 伪影

    :10 个对比模型中最少

  • 开放性

    :真正的开放权重,可微调,可自建,可商用

  • 分辨率

    :原生 4K,对手闭源产品多数卡在 720p

  • 生态

    :ComfyUI 首日支持,社区 LoRA 持续涌现

LTX-2.5 发布的 6.8 秒生成时间,让它在开源视频生成工具中进入了极少数模型才能到达的速度区间。

Seedance 2.5 在角色一致性上仍是值得尊敬的对手,但当一个开源模型在速度快 13 倍、分辨率高一倍、伪影更少的情况下,还能免费商用和本地部署------它已经不是「凑合能用」,而是真正可以进生产环境的选择。

复制代码
更多transformer,VIT,swin tranformer
参考头条号:人工智能研究所
v号:人工智能研究Suo, 启示AI科技

动画详解transformer 在线视频教程

相关推荐
阿维的博客日记1 小时前
什么是unigram语言模型
人工智能·语言模型·自然语言处理
碧海银沙音频科技研究院1 小时前
ONNX 的全称Open Neural Network Exchange(开放神经网络交换格式)
人工智能·音视频·语音识别
OpsEye1 小时前
直连大模型API、开源网关、商用AI管理平台,该如何抉择
人工智能·开源
杀生丸学AI1 小时前
【世界模型】Lyra 2.0:可探索的生成式3D世界(NVIDIA)
人工智能·深度学习·3d·数据挖掘·transformer·世界模型·高斯泼溅
xushichang123_1 小时前
工业企业推动自动化产线向自主化产线演进,云上物理 AI 与工业 Agent 方案如何选型?:优先采用 “云上智能底座+数字孪生+工业本体” 的分层架构
人工智能
hkNaruto1 小时前
【AI】规范驱动开发(SDD)团队实践指南 v2
人工智能·驱动开发
ClouGence2 小时前
2026 年 4 款数据库管理工具推荐:免费、开源、付费怎么选?
数据库·后端·开源
bittersuite2 小时前
BERT,fine-tuning
人工智能·深度学习·bert
武汉星际互动2 小时前
政务大厅引入AI数字人,需要关注哪些核心能力?
人工智能·政务
ZJU_统一阿萨姆2 小时前
【推理优化进阶】调度器的数学内核:排队论、SLO 与在线决策
开发语言·人工智能·语言模型·系统架构·vllm