技术栈
视频生成
小草cys
1 天前
大模型
·
多模态
·
视频生成
对比一下hunyuanvideo,wan2.2, minimax h3的性能
这三个都是 2025–2026 年比较主流的国产视频生成模型,定位差别挺明显:H3 更偏“全模态音视频一体 + 多参考编辑”,Wan2.2 更偏“电影级画面 + MoE 开源生态”,HunyuanVideo 1.5 更偏“轻量、稳定、低门槛文生/图生视频”。
漂着的圆木
2 天前
成本优化
·
视频生成
·
ai视频
·
模型路由
·
runway
AI视频模型路由怎么选?Runway新评测里的成本与可用率陷阱
同一批 AI 视频任务交给不同模型,最便宜的一次生成不一定得到较低的交付成本。Runway 9 月 24 日公布 Model Router 的 250 条图生视频提示词评测:不同路由配置的单条成本与“可用于生产”的比例明显分叉。团队要先定义自己的合格标准,再算每条合格片段实际花了多少,而不是只按调用价选择模型。
I Am a robert girl
2 天前
python
·
音视频
·
源码解析
·
视频生成
·
可控生成
·
流式生成
·
物理控制
PhysStream 源码级拆解:流式视频生成如何做到“边生成边控制“
从今天觉醒,技术赋予每一个人数字生命如果你最近在追视频生成,会发现一个尴尬的现实:模型能生成惊艳的画面,但你几乎无法在生成过程中"伸手进去"改变物体的运动。要么在开始前把整段控制信号一次性喂进去,要么用像素级的轨迹点去"拽"物体——前者不够灵活,后者控制的是位置而不是物理。PhysStream 试图回答的核心问题是:能不能让模型在生成过程中接受稀疏的物理控制信号,并保持场景的物理一致性?
Maynor996
3 天前
人工智能
·
aigc
·
视频生成
·
ai视频
·
可灵
Kling 4.0(可灵 4.0)怎么用?上线时间、Flash 版、价格与提示词全攻略(2026 最新)
更新说明:本文写于 2026 年 10 月 6 日(北京时间)。此时 Kling 4.0 完整版还没有正式上线,只有轻量版 Kling 4.0 Flash 对少部分付费会员开放了抢先体验。文中凡是标“官方暂未公布”的内容,都会在正式上线后补上。建议先收藏。
小草cys
5 天前
大模型
·
图像生成
·
多模态大模型
·
视频生成
·
minimax
·
wan
MiniMax H3 和 Wan2.2的对比
MiniMax H3 和 Wan2.2 都是当前顶尖的开源/可本地化视频生成模型,但它们的底层定位、优势赛道以及生成逻辑完全不同。
这张生成的图像能检测吗
7 天前
聚类
·
注意力机制
·
视频生成
(论文速读)AdaCluster:让视频 DiT 的稀疏注意力学会“区别对待”Q 和 K
论文题目: AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation 中文翻译: AdaCluster:面向视频生成稀疏注意力的自适应 Query-Key 聚类 会议: CVPR 2026 源码: https://github.com/USTC-MLSys-Team/Adacluster
I Am a robert girl
8 天前
人工智能
·
深度学习
·
计算机视觉
·
生成模型
·
视频生成
·
物理仿真
·
断裂模拟
从一张图到碎裂瞬间:FracGen 如何用物理信号“导演“物体撕裂
从今天觉醒,技术赋予每一个人数字生命过去两年,视频生成模型在画质上突飞猛进——Sora、可灵、Veo 系列已经能生成肉眼难辨真假的连续画面。但如果你让它们生成"玻璃杯从桌上摔下、裂纹从杯底蔓延到杯口"这类内容,结果往往令人失望:裂纹会凭空出现、传播方向诡异、材质表现和塑料没区别。问题不在于像素不够真,而在于模型根本没学会"物理状态"是什么。
敲代码的小霖
10 天前
ai
·
开源软件
·
视频生成
·
图片生成
·
ai短剧
·
无线画布
NovaNova Studio开源免费漫剧短剧生成平台
GitHub - Swayingleaves/novanova-studio: NovaNova Studio 是一个 Agent 驱动的 AI 创作工作台,集图片生成、视频生成、无限画布与多模型 API 、漫剧短剧生成于一体,为独立创作者和视觉团队打造更智能、更高效的创作体验。 · GitHub
东姬AI
20 天前
ai
·
数字人
·
多模态
·
视频生成
·
语音大模型
语音抢着实时,视频也抢着实时:两条赛道同时冲刺,交汇点却还差一步
过去24小时,AI行业上演了一场少见的"实时竞赛"。9月15日凌晨,谷歌发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,官方称这是其迄今最先进的对话式AI,能够在对话不中断的情况下调用工具、处理视觉信息、执行复杂任务;同一天,国内的阶跃星辰一口气放出StepAudio 3系列五款语音模型,其中Realtime版本在Artificial Analysis对话动态榜单以98.9%的综合得分排名全球第一;还是同一天,生数科技发布实时视频模型
这张生成的图像能检测吗
25 天前
扩散模型
·
视频生成
(论文速读)CogVideoX:用 3D Causal VAE 与 Expert Transformer 生成长时、高动态视频
论文题目: CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer 中文翻译: CogVideoX:基于专家 Transformer 的文本到视频扩散模型 会议: ICLR 2025
白拾
1 个月前
机器人操作
·
视频生成
·
世界模型
·
arxiv 2026
·
abot-physworld 论文分享
·
物理推理
【arXiv 2026】ABot-PhysWorld 论文解读:物理对齐的交互式世界基础模型|从视频生成物理AI评测视角
本文解读 arXiv 2026 论文《ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment》。该论文提出 ABot-PhysWorld 物理对齐交互式世界模型,通过融合物理感知数据管护、解耦判别器 Diffusion-DPO 对齐与零初始化动作注入,让 14B Diffusion Transformer 生成物理可信、动作可控的机器人操纵视频,其特别之处在于用"出
这张生成的图像能检测吗
1 个月前
人工智能
·
扩散模型
·
视频生成
·
特征缓存
·
步骤蒸馏
(论文速读)DISCA:利用与蒸馏兼容的可学习特征缓存加速视频扩散转换器
论文题目:DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching(DISCA:利用与蒸馏兼容的可学习特征缓存加速视频扩散转换器)
liferecords
1 个月前
开源
·
视频生成
·
推理优化
·
ai大厂
5 秒视频 1.65 秒生成:英伟达开源的这套推理栈,把「实时视频生成」钉进了现实
💡 一句话总结:NVIDIA Research 开源了 Sol-H3——针对 MiniMax-H3 视频模型的端到端推理加速栈,单台 8 卡 B300 上 5 秒带立体声的 1344×768 视频只要 1.653 秒生成,比播放还快。加速是「少步采样 + 免训练注意力稀疏 + 一整套系统优化」三层叠加,代码全开源;「边生成边看」从 PPT 叙事变成了可复现的工程事实。
VIP_CQCRE
1 个月前
ai
·
api
·
视频生成
·
kling
·
acedatacloud
用 Ace Data Cloud 接入 Kling Motion:让 AI 视频生成从“好看”走向“可控”
在短视频、产品演示、游戏角色展示、广告创意快速迭代越来越依赖 AI 的今天,单纯“文生视频”已经不够了。很多真实业务场景更关心的是:画面里的主体能不能按照我指定的方向动?角色动作能不能更可控?一张静态参考图能不能快速变成可用于 Demo 或营销素材的视频片段?
HyperAI超神经
1 个月前
人工智能
·
深度学习
·
学习
·
音视频
·
多模态
·
视频生成
·
推理模型
MiniMax H3 突破视频生成边界,音画内容一体生成;Ornith-1.5-35B-A3B 探索推理模型自进化训练新模式
MiniMax H3 是 MiniMax 推出的通用全模态生成模型,让模型从「理解内容」进一步走向「统一生成」。它能够同时处理文本、图片、视频和音频等复杂输入,并根据多模态上下文直接生成视频,最高支持 2K 分辨率、24 FPS 和 15 秒时长。与传统视频生成模型侧重单一任务不同,H3 将文生视频、图生视频、参考生视频和视频编辑等能力统一在同一模型中,并采用音画联合生成机制,一次性生成画面、语音、音效与音乐。在实际应用中,模型还强化了复杂指令遵循、画面文字与品牌 Logo 渲染、视频运动迁移等能力,为广
VIP_CQCRE
2 个月前
ai
·
aigc
·
api
·
视频生成
·
acedatacloud
用 Ace Data Cloud 快速接入 MiniMax H3:把 AI 视频生成能力变成可调用的生产力
过去一年,AI 视频生成已经从“新鲜 demo”进入到真正能服务业务的阶段:品牌短片、产品广告、短剧预告、社媒素材、电商种草视频,都开始需要更稳定、更可控、更容易集成的生成能力。
thesky123456
2 个月前
大模型
·
视频生成
·
sora
·
世界模型
·
jepa
·
生成式世界模型
·
dreamer
27届大模型面试准备(四十四):生成式世界模型与视频生成——从 JEPA 到 Sora/Genie
A40 讲了多模态大模型怎么把视觉编码器、投影器、图文对齐训在一起;A31 讲了多模态推理与视觉思维链。本篇再往前走一步,进入世界模型(World Model)——不只是"看懂一张图、答好一道题",而是让模型内部建模世界的动态规律:给定当前状态与一个动作/条件,能预测下一刻会发生什么。这是视频生成、具身智能、自动驾驶的共同底层,也是 2024–2026 最热的研究前沿。面试里能把它和"多模态理解"区分开,并讲清 JEPA、Dreamer、Sora、Genie 各自的范式,是拉开差距的关键。
找方案
2 个月前
开源
·
音视频
·
视频生成
·
开源大模型
·
minimax
·
多模态生成
·
h3模型
MiniMax开源5款大模型全链路,从文本到视频生成全覆盖
2026年8月11日,MiniMax的开源版图上又多了一颗棋子。截至这一天,这家公司已经开源了5款大模型产品。从文本到视频,从推理到生成,从单模态到多模态,五款模型连成一条清晰的进化线:底座、推理、多模态、生成。
key_3_feng
2 个月前
aigc
·
视频生成
Veo 提示词工程与创意工作流
做视频生成这两年,我最大的体会是:模型能力的上限,往往被提示词的下限锁死。同样一段"咖啡馆里一个人在煮咖啡",有人跑出来是广告大片,有人跑出来是模糊抖动的三秒切片。差别不在模型,而在你怎么"说"。这篇文章就聊 Veo 这类文生视频模型的提示词工程(Prompt Engineering),以及一套可复用的创意工作流。
白拾
2 个月前
数字人
·
音频驱动
·
视频生成
·
arxiv 2025
·
wan-s2v 论文分享
【arXiv 2025】音频驱动电影级视频生成 —— Wan-S2V 论文解读|从AI数字人内容创作视角
本文解读 arXiv 2025 论文《Wan-S2V: Audio-Driven Cinematic Video Generation》。该论文提出Wan-S2V 音频驱动电影级视频生成模型,通过融合文本全局运动控制(运镜、轨迹、交互)、音频局部细节驱动(表情、唇形、手势)与Wan 2.1 视频生成基座,把音频驱动人像生成从简单的 talking head 推进到影视级复杂场景。其特别之处在于全参数微调保持文本控制力,并用 FramePack 压缩运动帧 token 实现长视频一致。实验表明 EMTD 基