视频生成

HyperAI超神经2 天前
人工智能·深度学习·学习·音视频·多模态·视频生成·推理模型
MiniMax H3 突破视频生成边界,音画内容一体生成;Ornith-1.5-35B-A3B 探索推理模型自进化训练新模式MiniMax H3 是 MiniMax 推出的通用全模态生成模型,让模型从「理解内容」进一步走向「统一生成」。它能够同时处理文本、图片、视频和音频等复杂输入,并根据多模态上下文直接生成视频,最高支持 2K 分辨率、24 FPS 和 15 秒时长。与传统视频生成模型侧重单一任务不同,H3 将文生视频、图生视频、参考生视频和视频编辑等能力统一在同一模型中,并采用音画联合生成机制,一次性生成画面、语音、音效与音乐。在实际应用中,模型还强化了复杂指令遵循、画面文字与品牌 Logo 渲染、视频运动迁移等能力,为广
VIP_CQCRE8 天前
ai·aigc·api·视频生成·acedatacloud
用 Ace Data Cloud 快速接入 MiniMax H3:把 AI 视频生成能力变成可调用的生产力过去一年,AI 视频生成已经从“新鲜 demo”进入到真正能服务业务的阶段:品牌短片、产品广告、短剧预告、社媒素材、电商种草视频,都开始需要更稳定、更可控、更容易集成的生成能力。
thesky1234569 天前
大模型·视频生成·sora·世界模型·jepa·生成式世界模型·dreamer
27届大模型面试准备(四十四):生成式世界模型与视频生成——从 JEPA 到 Sora/GenieA40 讲了多模态大模型怎么把视觉编码器、投影器、图文对齐训在一起;A31 讲了多模态推理与视觉思维链。本篇再往前走一步,进入世界模型(World Model)——不只是"看懂一张图、答好一道题",而是让模型内部建模世界的动态规律:给定当前状态与一个动作/条件,能预测下一刻会发生什么。这是视频生成、具身智能、自动驾驶的共同底层,也是 2024–2026 最热的研究前沿。面试里能把它和"多模态理解"区分开,并讲清 JEPA、Dreamer、Sora、Genie 各自的范式,是拉开差距的关键。
找方案10 天前
开源·音视频·视频生成·开源大模型·minimax·多模态生成·h3模型
MiniMax开源5款大模型全链路,从文本到视频生成全覆盖2026年8月11日,MiniMax的开源版图上又多了一颗棋子。截至这一天,这家公司已经开源了5款大模型产品。从文本到视频,从推理到生成,从单模态到多模态,五款模型连成一条清晰的进化线:底座、推理、多模态、生成。
key_3_feng11 天前
aigc·视频生成
Veo 提示词工程与创意工作流做视频生成这两年,我最大的体会是:模型能力的上限,往往被提示词的下限锁死。同样一段"咖啡馆里一个人在煮咖啡",有人跑出来是广告大片,有人跑出来是模糊抖动的三秒切片。差别不在模型,而在你怎么"说"。这篇文章就聊 Veo 这类文生视频模型的提示词工程(Prompt Engineering),以及一套可复用的创意工作流。
白拾16 天前
数字人·音频驱动·视频生成·arxiv 2025·wan-s2v 论文分享
【arXiv 2025】音频驱动电影级视频生成 —— Wan-S2V 论文解读|从AI数字人内容创作视角本文解读 arXiv 2025 论文《Wan-S2V: Audio-Driven Cinematic Video Generation》。该论文提出Wan-S2V 音频驱动电影级视频生成模型,通过融合文本全局运动控制(运镜、轨迹、交互)、音频局部细节驱动(表情、唇形、手势)与Wan 2.1 视频生成基座,把音频驱动人像生成从简单的 talking head 推进到影视级复杂场景。其特别之处在于全参数微调保持文本控制力,并用 FramePack 压缩运动帧 token 实现长视频一致。实验表明 EMTD 基
敲代码的小霖18 天前
视频生成·图片生成·ai短剧·无线画布
Agent驱动的图片生成、视频生成、无限画布项目release v0.1.3 版本已发布修复和优化: 1、修复主 Agent 生成任务的用户原始提示词校验与回填逻辑,避免模型改写提示词导致计划校验失败; 2、修复 AI 图片接口以 Data URL 返回时的图片解析、保存及日志脱敏兼容问题; 3、优化模型渠道配置展示,新建渠道置顶、默认折叠渠道列表,并按创建时间倒序读取; 4、补充中英文 README、本地源码开发说明及 FFmpeg 容器依赖,完善模型与部署文档。
白拾23 天前
扩散模型·论文分享·视频生成·开源大模型·wan 2.1 论文分享·dit 架构·arxiv 2025
【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角本文解读 arXiv 2025 论文《Wan: Open and Advanced Large-Scale Video Generative Models》。该论文提出Wan 2.1 开源视频生成大模型,通过融合DiT 架构、Flow Matching 训练与Wan-VAE 时空压缩,以 14B 旗舰 + 1.3B 消费级双规模覆盖 8 大生成任务,其特别之处在于全栈开源(代码 + 权重 + 数据管线 + 评测工具)并首个支持视频内中英双语文字生成。实验表明 Wan 14B 在 VBench 总分 86.
AI工具测评与分析25 天前
人工智能·信息可视化·ai作画·视频生成·ai视频·爆款视频
Seedance2.5 赋能飙算画影AI无限画布,无边画布进阶专业创作工作台做 AI 短 / 漫剧的朋友们,最近有没有一种说不上来的别扭感?手里的工具生成能力是越来越顶了,可画布呢?还是老样子,一点新意都没有。从 0 到 1 铺素材,每个节点都得你一个个拖进来、连上线,光搭工作流就能耗掉大半天。
deepseek231 个月前
人工智能·多模态·视频生成
MiniMax H3 全模态模型拆解:2K 视频成本被腰斩背后,H3-VAE 和 In-context Regeneration 做了什么7 月 31 日,MiniMax 发布了全模态生成模型 H3,随后宣布将在几天内开放模型权重。消息传开后,资本市场先动了:MiniMax 股价盘中一度拉升 15%。但比起股价,我更想先算一笔账。
猫先生Mr.Mao1 个月前
ai·论文解读·视频生成·ai视频·longlive-2.0
视频生成之LongLive-2.0详解:如何把 5B 长视频生成推到 45.7 FPS【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
豌豆学姐1 个月前
aigc·音视频·api·视频生成·likeadmin-api
likeadmin-api 视频生成工作流实战:Seedance 2.0 接口从素材到任务查询最近做 AIGC 视频工具时,一个常见需求是:用户输入一段提示词,或者上传图片、视频、音频素材,然后系统自动生成短视频。这个需求看起来像一个“生成按钮”,但真正接入时会涉及素材管理、任务提交、异步查询、分辨率、时长、回调和成本控制。
云卷云舒___________2 个月前
华为·ai·grok·视频生成·gemini·ai日报·gpt56
Gemini 3.5 Pro或17日发布、Grok Imagine新增15秒视频生成、GPT-5.6 Sol 跑30小时超Opus | 7月5日 AI日报💡 今日趋势速览:Gemini 3.5 Pro发布概率达62%,xAI Grok Imagine新增视频生成,GPT-5.6 Sol效率超越Opus。
君为先-bey2 个月前
深度学习·扩散模型·视频生成·潜在扩散模型
LightningDiT----重建与生成:在潜在扩散模型中驯服优化困境论文标题Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
救救孩子把3 个月前
人工智能·视频生成·heygen
HyperFrames by HeyGen 入门教程HyperFrames by HeyGen 入门教程「milvus-course-ai.zip」 链接:https://pan.quark.cn/s/00f3d411bb6d
君为先-bey3 个月前
计算机视觉·多模态·扩散模型·视频生成
UniVidX——基于扩散先验的统一多模态视频生成框架UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
这是谁的博客?3 个月前
ai·google·架构·大模型·多模态·视频生成·gemini
[模型解析] Gemini: 多模态技术架构深度解析Google 在 2026 年 I/O 大会上发布了 Gemini 3.5 和 Gemini Omni,标志着多模态 AI 进入全新的发展阶段。本文将从技术架构角度深入解析 Gemini 的多模态能力设计。
YJlio4 个月前
自动化运维·视频生成·版本更新·ai agent·openclaw·dreaming·memory-wiki
OpenClaw v2026.4.11 更新解析:Dreaming 导入、结构化 WebChat、视频生成增强、Ollama 缓存与升级避坑大家好,我是 杨利杰YJlio。这篇文章继续整理 OpenClaw 版本更新记录。本文重点看的是 OpenClaw v2026.4.11。
YJlio4 个月前
memory·自动化运维·comfyui·视频生成·版本更新·ai agent·openclaw
OpenClaw v2026.4.5 更新解析:视频/音乐生成、ComfyUI 工作流、多语言控制台、Memory Dreaming 与升级避坑大家好,我是 杨利杰YJlio。这篇文章继续整理 OpenClaw 版本更新记录。本文重点看的是 OpenClaw v2026.4.5。