视频生成

这张生成的图像能检测吗5 天前
扩散模型·视频生成
(论文速读)CogVideoX:用 3D Causal VAE 与 Expert Transformer 生成长时、高动态视频论文题目: CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer 中文翻译: CogVideoX:基于专家 Transformer 的文本到视频扩散模型 会议: ICLR 2025
白拾7 天前
机器人操作·视频生成·世界模型·arxiv 2026·abot-physworld 论文分享·物理推理
【arXiv 2026】ABot-PhysWorld 论文解读:物理对齐的交互式世界基础模型|从视频生成物理AI评测视角本文解读 arXiv 2026 论文《ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment》。该论文提出 ABot-PhysWorld 物理对齐交互式世界模型,通过融合物理感知数据管护、解耦判别器 Diffusion-DPO 对齐与零初始化动作注入,让 14B Diffusion Transformer 生成物理可信、动作可控的机器人操纵视频,其特别之处在于用"出
这张生成的图像能检测吗8 天前
人工智能·扩散模型·视频生成·特征缓存·步骤蒸馏
(论文速读)DISCA:利用与蒸馏兼容的可学习特征缓存加速视频扩散转换器论文题目:DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching(DISCA:利用与蒸馏兼容的可学习特征缓存加速视频扩散转换器)
liferecords9 天前
开源·视频生成·推理优化·ai大厂
5 秒视频 1.65 秒生成:英伟达开源的这套推理栈,把「实时视频生成」钉进了现实💡 一句话总结:NVIDIA Research 开源了 Sol-H3——针对 MiniMax-H3 视频模型的端到端推理加速栈,单台 8 卡 B300 上 5 秒带立体声的 1344×768 视频只要 1.653 秒生成,比播放还快。加速是「少步采样 + 免训练注意力稀疏 + 一整套系统优化」三层叠加,代码全开源;「边生成边看」从 PPT 叙事变成了可复现的工程事实。
VIP_CQCRE13 天前
ai·api·视频生成·kling·acedatacloud
用 Ace Data Cloud 接入 Kling Motion:让 AI 视频生成从“好看”走向“可控”在短视频、产品演示、游戏角色展示、广告创意快速迭代越来越依赖 AI 的今天,单纯“文生视频”已经不够了。很多真实业务场景更关心的是:画面里的主体能不能按照我指定的方向动?角色动作能不能更可控?一张静态参考图能不能快速变成可用于 Demo 或营销素材的视频片段?
HyperAI超神经22 天前
人工智能·深度学习·学习·音视频·多模态·视频生成·推理模型
MiniMax H3 突破视频生成边界,音画内容一体生成;Ornith-1.5-35B-A3B 探索推理模型自进化训练新模式MiniMax H3 是 MiniMax 推出的通用全模态生成模型,让模型从「理解内容」进一步走向「统一生成」。它能够同时处理文本、图片、视频和音频等复杂输入,并根据多模态上下文直接生成视频,最高支持 2K 分辨率、24 FPS 和 15 秒时长。与传统视频生成模型侧重单一任务不同,H3 将文生视频、图生视频、参考生视频和视频编辑等能力统一在同一模型中,并采用音画联合生成机制,一次性生成画面、语音、音效与音乐。在实际应用中,模型还强化了复杂指令遵循、画面文字与品牌 Logo 渲染、视频运动迁移等能力,为广
VIP_CQCRE1 个月前
ai·aigc·api·视频生成·acedatacloud
用 Ace Data Cloud 快速接入 MiniMax H3:把 AI 视频生成能力变成可调用的生产力过去一年,AI 视频生成已经从“新鲜 demo”进入到真正能服务业务的阶段:品牌短片、产品广告、短剧预告、社媒素材、电商种草视频,都开始需要更稳定、更可控、更容易集成的生成能力。
thesky1234561 个月前
大模型·视频生成·sora·世界模型·jepa·生成式世界模型·dreamer
27届大模型面试准备(四十四):生成式世界模型与视频生成——从 JEPA 到 Sora/GenieA40 讲了多模态大模型怎么把视觉编码器、投影器、图文对齐训在一起;A31 讲了多模态推理与视觉思维链。本篇再往前走一步,进入世界模型(World Model)——不只是"看懂一张图、答好一道题",而是让模型内部建模世界的动态规律:给定当前状态与一个动作/条件,能预测下一刻会发生什么。这是视频生成、具身智能、自动驾驶的共同底层,也是 2024–2026 最热的研究前沿。面试里能把它和"多模态理解"区分开,并讲清 JEPA、Dreamer、Sora、Genie 各自的范式,是拉开差距的关键。
找方案1 个月前
开源·音视频·视频生成·开源大模型·minimax·多模态生成·h3模型
MiniMax开源5款大模型全链路,从文本到视频生成全覆盖2026年8月11日,MiniMax的开源版图上又多了一颗棋子。截至这一天,这家公司已经开源了5款大模型产品。从文本到视频,从推理到生成,从单模态到多模态,五款模型连成一条清晰的进化线:底座、推理、多模态、生成。
key_3_feng1 个月前
aigc·视频生成
Veo 提示词工程与创意工作流做视频生成这两年,我最大的体会是:模型能力的上限,往往被提示词的下限锁死。同样一段"咖啡馆里一个人在煮咖啡",有人跑出来是广告大片,有人跑出来是模糊抖动的三秒切片。差别不在模型,而在你怎么"说"。这篇文章就聊 Veo 这类文生视频模型的提示词工程(Prompt Engineering),以及一套可复用的创意工作流。
白拾1 个月前
数字人·音频驱动·视频生成·arxiv 2025·wan-s2v 论文分享
【arXiv 2025】音频驱动电影级视频生成 —— Wan-S2V 论文解读|从AI数字人内容创作视角本文解读 arXiv 2025 论文《Wan-S2V: Audio-Driven Cinematic Video Generation》。该论文提出Wan-S2V 音频驱动电影级视频生成模型,通过融合文本全局运动控制(运镜、轨迹、交互)、音频局部细节驱动(表情、唇形、手势)与Wan 2.1 视频生成基座,把音频驱动人像生成从简单的 talking head 推进到影视级复杂场景。其特别之处在于全参数微调保持文本控制力,并用 FramePack 压缩运动帧 token 实现长视频一致。实验表明 EMTD 基
敲代码的小霖1 个月前
视频生成·图片生成·ai短剧·无线画布
Agent驱动的图片生成、视频生成、无限画布项目release v0.1.3 版本已发布修复和优化: 1、修复主 Agent 生成任务的用户原始提示词校验与回填逻辑,避免模型改写提示词导致计划校验失败; 2、修复 AI 图片接口以 Data URL 返回时的图片解析、保存及日志脱敏兼容问题; 3、优化模型渠道配置展示,新建渠道置顶、默认折叠渠道列表,并按创建时间倒序读取; 4、补充中英文 README、本地源码开发说明及 FFmpeg 容器依赖,完善模型与部署文档。
白拾1 个月前
扩散模型·论文分享·视频生成·开源大模型·wan 2.1 论文分享·dit 架构·arxiv 2025
【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角本文解读 arXiv 2025 论文《Wan: Open and Advanced Large-Scale Video Generative Models》。该论文提出Wan 2.1 开源视频生成大模型,通过融合DiT 架构、Flow Matching 训练与Wan-VAE 时空压缩,以 14B 旗舰 + 1.3B 消费级双规模覆盖 8 大生成任务,其特别之处在于全栈开源(代码 + 权重 + 数据管线 + 评测工具)并首个支持视频内中英双语文字生成。实验表明 Wan 14B 在 VBench 总分 86.
AI工具测评与分析1 个月前
人工智能·信息可视化·ai作画·视频生成·ai视频·爆款视频
Seedance2.5 赋能飙算画影AI无限画布,无边画布进阶专业创作工作台做 AI 短 / 漫剧的朋友们,最近有没有一种说不上来的别扭感?手里的工具生成能力是越来越顶了,可画布呢?还是老样子,一点新意都没有。从 0 到 1 铺素材,每个节点都得你一个个拖进来、连上线,光搭工作流就能耗掉大半天。
deepseek232 个月前
人工智能·多模态·视频生成
MiniMax H3 全模态模型拆解:2K 视频成本被腰斩背后,H3-VAE 和 In-context Regeneration 做了什么7 月 31 日,MiniMax 发布了全模态生成模型 H3,随后宣布将在几天内开放模型权重。消息传开后,资本市场先动了:MiniMax 股价盘中一度拉升 15%。但比起股价,我更想先算一笔账。
猫先生Mr.Mao2 个月前
ai·论文解读·视频生成·ai视频·longlive-2.0
视频生成之LongLive-2.0详解:如何把 5B 长视频生成推到 45.7 FPS【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
豌豆学姐2 个月前
aigc·音视频·api·视频生成·likeadmin-api
likeadmin-api 视频生成工作流实战:Seedance 2.0 接口从素材到任务查询最近做 AIGC 视频工具时,一个常见需求是:用户输入一段提示词,或者上传图片、视频、音频素材,然后系统自动生成短视频。这个需求看起来像一个“生成按钮”,但真正接入时会涉及素材管理、任务提交、异步查询、分辨率、时长、回调和成本控制。
云卷云舒___________2 个月前
华为·ai·grok·视频生成·gemini·ai日报·gpt56
Gemini 3.5 Pro或17日发布、Grok Imagine新增15秒视频生成、GPT-5.6 Sol 跑30小时超Opus | 7月5日 AI日报💡 今日趋势速览:Gemini 3.5 Pro发布概率达62%,xAI Grok Imagine新增视频生成,GPT-5.6 Sol效率超越Opus。
君为先-bey3 个月前
深度学习·扩散模型·视频生成·潜在扩散模型
LightningDiT----重建与生成:在潜在扩散模型中驯服优化困境论文标题Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models