视频生成

白拾2 天前
扩散模型·论文分享·视频生成·开源大模型·wan 2.1 论文分享·dit 架构·arxiv 2025
【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角本文解读 arXiv 2025 论文《Wan: Open and Advanced Large-Scale Video Generative Models》。该论文提出Wan 2.1 开源视频生成大模型,通过融合DiT 架构、Flow Matching 训练与Wan-VAE 时空压缩,以 14B 旗舰 + 1.3B 消费级双规模覆盖 8 大生成任务,其特别之处在于全栈开源(代码 + 权重 + 数据管线 + 评测工具)并首个支持视频内中英双语文字生成。实验表明 Wan 14B 在 VBench 总分 86.
AI工具测评与分析4 天前
人工智能·信息可视化·ai作画·视频生成·ai视频·爆款视频
Seedance2.5 赋能飙算画影AI无限画布,无边画布进阶专业创作工作台做 AI 短 / 漫剧的朋友们,最近有没有一种说不上来的别扭感?手里的工具生成能力是越来越顶了,可画布呢?还是老样子,一点新意都没有。从 0 到 1 铺素材,每个节点都得你一个个拖进来、连上线,光搭工作流就能耗掉大半天。
deepseek237 天前
人工智能·多模态·视频生成
MiniMax H3 全模态模型拆解:2K 视频成本被腰斩背后,H3-VAE 和 In-context Regeneration 做了什么7 月 31 日,MiniMax 发布了全模态生成模型 H3,随后宣布将在几天内开放模型权重。消息传开后,资本市场先动了:MiniMax 股价盘中一度拉升 15%。但比起股价,我更想先算一笔账。
猫先生Mr.Mao15 天前
ai·论文解读·视频生成·ai视频·longlive-2.0
视频生成之LongLive-2.0详解:如何把 5B 长视频生成推到 45.7 FPS【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
豌豆学姐21 天前
aigc·音视频·api·视频生成·likeadmin-api
likeadmin-api 视频生成工作流实战:Seedance 2.0 接口从素材到任务查询最近做 AIGC 视频工具时,一个常见需求是:用户输入一段提示词,或者上传图片、视频、音频素材,然后系统自动生成短视频。这个需求看起来像一个“生成按钮”,但真正接入时会涉及素材管理、任务提交、异步查询、分辨率、时长、回调和成本控制。
云卷云舒___________1 个月前
华为·ai·grok·视频生成·gemini·ai日报·gpt56
Gemini 3.5 Pro或17日发布、Grok Imagine新增15秒视频生成、GPT-5.6 Sol 跑30小时超Opus | 7月5日 AI日报💡 今日趋势速览:Gemini 3.5 Pro发布概率达62%,xAI Grok Imagine新增视频生成,GPT-5.6 Sol效率超越Opus。
君为先-bey2 个月前
深度学习·扩散模型·视频生成·潜在扩散模型
LightningDiT----重建与生成:在潜在扩散模型中驯服优化困境论文标题Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
救救孩子把2 个月前
人工智能·视频生成·heygen
HyperFrames by HeyGen 入门教程HyperFrames by HeyGen 入门教程「milvus-course-ai.zip」 链接:https://pan.quark.cn/s/00f3d411bb6d
君为先-bey2 个月前
计算机视觉·多模态·扩散模型·视频生成
UniVidX——基于扩散先验的统一多模态视频生成框架UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
这是谁的博客?3 个月前
ai·google·架构·大模型·多模态·视频生成·gemini
[模型解析] Gemini: 多模态技术架构深度解析Google 在 2026 年 I/O 大会上发布了 Gemini 3.5 和 Gemini Omni,标志着多模态 AI 进入全新的发展阶段。本文将从技术架构角度深入解析 Gemini 的多模态能力设计。
YJlio3 个月前
自动化运维·视频生成·版本更新·ai agent·openclaw·dreaming·memory-wiki
OpenClaw v2026.4.11 更新解析:Dreaming 导入、结构化 WebChat、视频生成增强、Ollama 缓存与升级避坑大家好,我是 杨利杰YJlio。这篇文章继续整理 OpenClaw 版本更新记录。本文重点看的是 OpenClaw v2026.4.11。
YJlio3 个月前
memory·自动化运维·comfyui·视频生成·版本更新·ai agent·openclaw
OpenClaw v2026.4.5 更新解析:视频/音乐生成、ComfyUI 工作流、多语言控制台、Memory Dreaming 与升级避坑大家好,我是 杨利杰YJlio。这篇文章继续整理 OpenClaw 版本更新记录。本文重点看的是 OpenClaw v2026.4.5。
阿钱真强道4 个月前
aigc·animatediff·stable-diffusion·comfyui·视频生成·图生视频·单图转视频
19 基于 ComfyUI 工作流学习 AnimateDiff:单图生成视频的入门实践与问题分析AnimateDiff 是当前基于扩散模型实现图像动态化的重要方案之一,在 ComfyUI 生态中也已经形成了较为成熟的接入方式。对于初学者而言,单图生成视频是理解 AnimateDiff 工作机制的一个合适入口。
Rubin智造社4 个月前
google·nvidia·视频生成·ai芯片·ai助手·workspace·安全治理
04月23日AI每日参考:Google推出AI芯片挑战Nvidia,Workspace升级AI助手今天AI圈有两件值得关注的事。其一,Google Cloud推出新一代AI芯片与Nvidia竞争,标志着AI芯片市场竞争加剧;其二,Google Workspace升级AI功能,让AI成为办公室"实习生",AI应用进入企业办公核心。10条精选资讯,带你快速掌握今日AI动态。
阿钱真强道4 个月前
aigc·sdxl·stablediffusion·扩散模型·视频生成·sdv·图片生成
08 ComfyUI + SVD 系列(六)从 SDXL 到 SDV:为什么说视频生成本质上是“带时间维度的图片生成”?如果你已经用过 SDXL 生成图片,又开始接触 SDV 这类视频模型,那么你大概率会冒出这样一个想法:
CV-deeplearning4 个月前
音视频·数字人·视频生成·infinitetalk·说话视频
美团 AI 开源!一段音频驱动无限时长说话视频,嘴唇/头部/表情全同步,支持 ComfyUI 一键部署一句话介绍:InfiniteTalk 是美团 MeiGen-AI 团队开源的音频驱动视频生成框架,基于 Wan2.1-14B 大模型,支持图片/视频转说话视频,无限时长生成,嘴唇、头部动作、身体姿态、面部表情全部跟着音频走。
杀生丸学AI4 个月前
人工智能·三维重建·扩散模型·具身智能·视频生成·世界模型·空间智能
【世界模型】video2world:从不一致视角重建世界标题:World Reconstruction From Inconsistent Views 来源:德国慕尼黑工业大学 链接:https://lukashoel.github.io/video_to_world
这张生成的图像能检测吗5 个月前
扩散模型·视频生成·可控交互动力学
(论文速读)InterDyn: 视频扩散模型的可控交互动力学论文题目:InterDyn: Controllable Interactive Dynamics with Video Diffusion Models(视频扩散模型的可控交互动力学)
顾道长生'5 个月前
视频生成·自回归·长视频生成
(CVPR-2025)从缓慢的双向视频扩散模型到快速的自回归视频扩散模型paper title:From Slow Bidirectional to Fast Autoregressive Video Diffusion Models