青稞Talk预告!面向自动驾驶与物理世界对齐的视频生成模型

青稞Talk预告!面向自动驾驶与物理世界对齐的视频生成模型

为何现有视频生成模型难以理解物理世界,无法生成运动合理的视频结果?基于认知心理学研究,我们重新审视现有视频生成模型,认为生成运动合理的视频其实是和生成高视觉质量视频同样困难的任务,而现有一阶段建模方式更关注视觉质量,缺少对运动的关注。

为此,香港科技大学(广州)的研究者提出了两阶段模型 Motion Dreamer,通过生成中间运动表示,将运动和视觉质量进行解耦,从而生成运动合理且高视觉质量的视频。

复制代码
Abs:https://arxiv.org/pdf/2412.00547

1月14日19:00 ,青稞Talk 第37期,香港科技大学(广州)博士生许添硕,将直播分享《Motion Dreamer:面向自动驾驶与物理世界对齐的视频生成模型》。

许添硕,香港科技大学(广州)博士生,导师为陈颖聪教授,研究兴趣是自动驾驶、视频生成。

相关推荐
seowmt1 分钟前
结构化数据和自然语言描述哪个更管用?答案分场景
人工智能·google·typescript·go语言·schema
海宇数据3 分钟前
零信任架构实战:基于海宇车型识别精准构建自动化违章处理网关
运维·人工智能·架构·自动化
XMAIPC_Robot4 分钟前
RK3588+CODESYS+RK182X AI 扩展机器人控制器解决方案|硬实时运动控制 + 大算力边缘 AI 融合实战
人工智能·机器人·rk3588+codesys·arm+codesys
陕西企来客6 分钟前
NAP 信息统一治理:构建生成式 AI 时代企业 GEO 增长的坚实底座-企来客科技NAP方法论-企来客科技NAP信息治理实战解析
大数据·人工智能·科技
a努力。7 分钟前
SpringBoot4迁移:Jackson3包名大变,注解别乱改
人工智能
SamChan908 分钟前
PDF翻译时页眉页脚总在捣乱?跨页重复文本块的检测与过滤实测
人工智能·python·ai·pdf·wpf
徐健峰9 分钟前
JEV 1.13 接入教程:Python 调用 Decisions API,实现分类、评分与 Agent 路由
人工智能
CubeSandbox13 分钟前
沙箱是选项,不是标配:花椒 Agent 平台的架构思考与 Cube 实践
大数据·人工智能·架构
Rocky Ding*15 分钟前
一文读懂Qwen-Audio-3.1核心基础知识:从语音识别到可控声景与实时Agent
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·qwen-audio
桃西西呀17 分钟前
Laya 源码级原理拆解之四:路由检测与服务部署
人工智能·llm·ai编程