
LTX-2.5 是 Lightricks(LTX)发布的开源"世界模型"(open world model)。 它主要用来生成高质量、带同步音频的视频,输入可以是文字、图片、视频或音频。简单说,就是一个能同时产出画面和声音的 AI 视频生成工具,而且支持本地部署,不依赖云端 API 计费。
主要特点
原生多镜头生成:一次就能生成多个连贯镜头(比如远景→中景→特写),人物、环境、光线、声音风格都能保持一致,不用再手动拼接。
画面更清晰、细节更好:新的扩散视频解码器让人脸、纹理、屏幕文字更锐利,运动更自然,伪影更少。
智能分配计算资源:根据场景复杂度动态调整,重要地方画得细,简单地方省资源。
更好的文字理解:用了定制的 Gemma 4 12B 文本编码器 + 提示词增强器,复杂提示(多角色、镜头运动、灯光、动作)不容易丢细节。
自动时长预测:可以让模型根据提示自动决定视频长度,不用手动设帧数。
蒸馏版更快更好用:有体积更小、速度更快的蒸馏模型,质量接近完整版,适合普通硬件。
支持多种输入输出:文字→视频、图片→视频、视频→视频、音频相关生成等,还能同步生成音频。
应用领域
影视与内容创作:短片、广告、概念预览、多镜头叙事视频制作。工作室可直接用于生产流程,保持风格和角色一致性。
实时与交互应用:低延迟生成,适合互动化身、实时虚拟世界、直播类场景。
机器人与物理AI:可微调到真实物理场景数据,用于机器人仿真、环境理解等新兴方向(目前还在发展中)。
专业后期与VFX:支持HDR/ACES工作流,输出可接入专业调色和成片管线。
使用教程: (建议N卡,显存8G起,支持50系显卡)
整合包包含所需所有节点,下载主程序和模型(ComfyUI文件夹),解压主程序一键包,将ComfyUI文件夹移动到主程序目录下即可。
WebUI模式:
双击启动跳转,进入WebUI后,根据需要选择生成方式(支持文生视频、图生视频和首尾帧视频生成),输入提示词,上传参考图,设置相关参数,运行生成即可。
ComfyUI模式:
双击启动ComfyUI,进入WebUI后,点击左侧的 工作流程,选择对应的工作流
根据需要选择对应工作流(支持文生视频、图生视频和首尾帧视频生成),设置相关参数,运行即可。
实测显存8G起(运存32G)可流畅运行文生视频,图生视频参数需要调低,建议图生视频12G显存起。
LTX 吃提示词,可以参考官方提示词指南 https://docs.ltx.io/open-source- ... des/prompting-guide 。官方也支持提示词增强,可以使用简单的提示词,勾选"提示词增强",会消耗更多显存。 如果需要自行编写提示词,请不要勾选。
软件目录结构:
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors
│ ├── 📂 latent_upscale_models/
│ │ └── ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors
│ ├── 📂 text_encoders/
│ │ └── gemma4_e2b_it_bf16.safetensors
│ │ └── gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors
│ └── 📂 vae/
│ └── ltx-2.5-audio-vae-bf16.safetensors
│ └── ltx-2.5-video-vae-bf16.safetensors
📂 deepface/
......
下载地址:点此下载