Allegro:强大的文本到视频模型

Allegro是一款先进的文本到视频生成模型,能够从简单的文本输入生成高质量的视频。这些视频长达6秒,以每秒15帧(FPS)的速度和720p的分辨率呈现,为视频内容创作带来了新的可能性。

Allegro模型信息

  • 模型名称:Allegro
  • 描述:文本到视频生成模型
  • 下载:可在Hugging Face上找到
  • 参数
    • VAE:175M
    • DiT:2.8B
  • 推理精度
    • VAE:FP32/TF32/BF16/FP16(推荐使用FP32/TF32)
    • DiT/T5:BF16/FP32/TF32
  • 上下文长度:79.2K
  • 分辨率:720 x 1280
  • 帧数:88
  • 视频长度:6秒 @ 15 FPS
  • 单GPU内存使用量:9.3G BF16(启用cpu_offload时)

快速开始

要开始使用Allegro,你需要按照以下步骤操作:

  1. 下载Allegro GitHub代码
  2. 安装必要的依赖
  3. 确保Python版本大于等于3.10,PyTorch版本大于等于2.4,CUDA版本大于等于12.4。具体详情可查看requirements.txt文件。
  4. 推荐使用Anaconda创建新环境(Python >= 3.10)来运行以下示例。
  5. 下载Allegro模型权重
  6. 运行推理

以下是运行推理的示例命令:

bash

复制代码
python single_inference.py \
--user_prompt 'A seaside harbor with bright sunlight and sparkling seawater, with many boats in the water. From an aerial view, the boats vary in size and color, some moving and some stationary. Fishing boats in the water suggest that this location might be a popular spot for docking fishing boats.' \
--save_path ./output_videos/test_video.mp4 \
--vae your/path/to/vae \
--dit your/path/to/transformer \
--text_encoder your/path/to/text_encoder \
--tokenizer your/path/to/tokenizer \
--guidance_scale 7.5 \
--num_sampling_steps 100 \
--seed 42

使用--enable_cpu_offload可以将模型卸载到CPU以减少GPU内存使用(约9.3G,如果不启用CPU卸载则为27.5G),但推理时间将显著增加。

(可选)将视频插值到30 FPS。

推荐使用EMA-VFI将视频从15 FPS插值到30 FPS。

为了更好的视觉质量,请使用imageio保存视频。

限制

该模型无法渲染名人、可读文本、特定地点、街道或建筑物。

未来计划

  • 多GPU推理和进一步加速(PAB)
  • 文本&图像到视频(TI2V)视频生成
  • 动作控制视频生成
  • 视觉质量增强

结语

Allegro为视频内容创作带来了新的便利性和效率。如果你对这个模型感兴趣,可以访问其Hugging Face页面、博客、论文或加入等待名单来了解更多信息,并尝试在Discord上使用它。

相关推荐
咕噜企业分发小米5 分钟前
腾讯云向量数据库HNSW索引如何更新?
人工智能·算法·腾讯云
AI即插即用9 分钟前
即插即用系列 | TGRS 2025 MGAM:面向遥感微小目标检测的多尺度高斯注意力机制
图像处理·人工智能·深度学习·目标检测·计算机视觉·视觉检测
cqbzcsq16 分钟前
蛋白质功能预测模型DAMPE论文阅读报告
论文阅读·人工智能·python·深度学习·生物信息学
转转技术团队20 分钟前
回收团队基于Cursor集成MCP的智能代码修复提示词生成实践
人工智能·python·程序员
质变科技AI就绪数据云32 分钟前
AI Data独角兽猎手的12个预测(2026)
人工智能·向量数据库·ai agent
互联网志37 分钟前
交通运输行业作为人工智能落地领域,是一个庞大的人工智能应用场景
人工智能·百度
小程故事多_8038 分钟前
Agent Skills深度解析,让智能体从“会连接”到“会做事”的核心引擎
数据库·人工智能·aigc
9527华安42 分钟前
Artix7系列FPGA实现SDI视频解码转CameraLink,基于GTP高速收发器+OSERDES2原语架构,提供2套工程源码和技术支持
fpga开发·架构·音视频
啊巴矲1 小时前
小白从零开始勇闯人工智能:深度学习初级篇(初识深度学习及环境的配置与安装)
人工智能·深度学习
白白要坚持1 小时前
本地部署jina-bert
人工智能·bert·jina