世界模型

audyxiao0012 小时前
iclr·论文分享·世界模型·机器人策略
人工智能顶会ICLR 2026论文分享|Ctrl-World:让机器人策略在想象空间中完成评估与改进机器人学习领域一直有个核心难题,如何在不依赖大量真实机器人rollout的情况下,判断通用机器人策略是否真正理解了指令,并进一步利用这些经验提升策略在陌生物体和新任务上的表现。真实世界中的策略评估通常需要反复执行任务,研究者不仅要准备不同的物体、场景和相机位置,还需要通过多次实验获得具有统计意义的结果。当策略在某类任务上失败时,后续改进往往还需要重新采集专家示范数据。这个过程成本较高,也限制了通用机器人策略的迭代速度。近期,来自斯坦福大学和清华大学的研究团队在ICLR 2026上提出Ctrl-World,
东姬AI3 天前
多模态·ai数字人·世界模型·ai视频生成·音画同步
当世界模型学会“开口说话“:从EchoWM开源,看AI生成内容的音画合流过去两年,AI视频生成的进步几乎都发生在"画面"上:分辨率从480P卷到1080P,时长从几秒卷到几十秒,物理规律和运镜质感也在肉眼可见地逼近实拍。但有一个维度长期被搁置在次要位置——声音。绝大多数视频生成模型产出的内容是"默片",配音、音效、环境声要靠后期另外补。9月初的京东全球科技探索者大会(JDD)上,京东探索研究院开源的交互视听世界模型EchoWM,把这个问题重新推到了台前:它生成的不是"带画面的视频",而是画面、环境音、音乐和语音原生同步的视听内容,并且允许用户像玩游戏一样走进去持续探索。
白拾6 天前
机器人操作·视频生成·世界模型·arxiv 2026·abot-physworld 论文分享·物理推理
【arXiv 2026】ABot-PhysWorld 论文解读:物理对齐的交互式世界基础模型|从视频生成物理AI评测视角本文解读 arXiv 2026 论文《ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment》。该论文提出 ABot-PhysWorld 物理对齐交互式世界模型,通过融合物理感知数据管护、解耦判别器 Diffusion-DPO 对齐与零初始化动作注入,让 14B Diffusion Transformer 生成物理可信、动作可控的机器人操纵视频,其特别之处在于用"出
ergevv6 天前
卡尔曼滤波·预测·世界模型·rssm
RSSM 与卡尔曼滤波:相似的思想,不同的世界模型第一次看到 RSSM(Recurrent State-Space Model,循环状态空间模型)时,会产生一个很自然的感觉:它和卡尔曼滤波都在“根据过去预测现在,再用新观测修正预测”。这个感觉是对的,但还不够精确。
deepseek239 天前
具身智能·vla·世界模型·机器人基础模型·多机器人协作
芝诺 Zeno-1 去中心化协作具身基础模型拆解:3B 参数把多机器人协作写进单一策略,CPI 闭环训练与行动条件世界模型如何预警接触失败给两台工业机械臂设计协作系统,最直觉的思路是先让它们互相商量。谁先抬哪头,谁后发力,顺序写进通信协议里,两台照章执行就行。可机械车间里根本没有这么干净的剧本,钢珠会在托盘上滑动。光源会让相机偏转,协议里写死的理想状态,一到真实环境就全部失效。
HyperAI超神经10 天前
人工智能·深度学习·机器人·英伟达·世界模型
机器人运动误差降低90.4%,英伟达/哈佛等提出Hydra-0,用Action Flow统一世界建模与控制如果说大模型正在让机器「理解语言」,那么世界模型(World Model)试图解决的,则是让机器真正理解一个更复杂的问题:做出一个动作之后,现实世界会发生什么?
feasibility.13 天前
人工智能·aigc·视频·地图·具身智能·英伟达·世界模型
ABot-World-0:当一块 RTX 5090 能编织无限世界——交互式世界模型的高德解法一句话总结:高德 AMAP CV Lab 用一张 RTX 5090,把“无限交互世界”从数据中心的幻想拉进了你的桌面机箱。5B 参数的因果学生模型,基于 Wan2.2 骨干,经三阶段渐进蒸馏(Teacher Forcing → ODE Distillation → LongForcing),在 720P/16FPS/1.2s 延迟/~19GB 显存的约束下,实现了小时级甚至日级不崩溃的闭环交互世界 rollout。
luckystar513~16 天前
世界模型·李飞飞·atlas世界模型
如何看待,李飞飞的世界模型AtLas【生成、重建和时空建模三统一】李飞飞团队今日发布的Atlas,确实可以被视为AI发展历程中的一个重要节点。它不再满足于生成平面的图像或视频,而是旨在构建一个可交互、可度量的三维世界。作为一个“多模态自回归扩散Transformer”,Atlas的核心突破在于将空间智能(Spatial Intelligence)从理论推向了工程实践。
音视频牛哥16 天前
人工智能·具身智能·世界模型·world model·vla模型·多模态感知·机器人决策
世界模型如何重塑具身智能:从VLA到预测式机器人控制围绕“世界模型是不是机器人下一个奇点时刻”的讨论正在升温。过去几年,具身智能的发展重点集中在大模型、VLA(Vision-Language-Action)、模仿学习和遥操作数据上:让机器人看懂场景、理解语言,并根据输入直接生成动作。如今,行业开始把更多注意力转向世界模型,因为仅仅知道“应该做什么”,并不等于能够判断“做完以后世界会发生什么”。
七77.20 天前
3d·agent·世界模型
SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation原文链接:https://arxiv.org/pdf/2603.12238 源码链接:https://github.com/ROUJINN/SceneAssistant
thesky1234561 个月前
大模型·视频生成·sora·世界模型·jepa·生成式世界模型·dreamer
27届大模型面试准备(四十四):生成式世界模型与视频生成——从 JEPA 到 Sora/GenieA40 讲了多模态大模型怎么把视觉编码器、投影器、图文对齐训在一起;A31 讲了多模态推理与视觉思维链。本篇再往前走一步,进入世界模型(World Model)——不只是"看懂一张图、答好一道题",而是让模型内部建模世界的动态规律:给定当前状态与一个动作/条件,能预测下一刻会发生什么。这是视频生成、具身智能、自动驾驶的共同底层,也是 2024–2026 最热的研究前沿。面试里能把它和"多模态理解"区分开,并讲清 JEPA、Dreamer、Sora、Genie 各自的范式,是拉开差距的关键。
猫先生Mr.Mao1 个月前
论文解读·具身智能·vla·机器人学习·世界模型
具身智能之UniJEPA详解:让机器人同时“听懂、预见、动起来”的统一表征学习【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
杀生丸学AI1 个月前
人工智能·深度学习·3d·数据挖掘·transformer·世界模型·高斯泼溅
【世界模型】Lyra 2.0:可探索的生成式3D世界(NVIDIA)图1:Lyra 2.0能够基于单张图像实现长视距的三维一致性场景生成。用户可从输入图像出发,通过迭代定义相机运动来探索场景;与此同时,Lyra 2.0会合成具有空间持续性的视频输出,逐步扩展场景环境。这些视频可直接重构为高保真3DGS与表面网格,从而生成可在仿真引擎及交互式查看器中部署的3D资产。
chen_zn951 个月前
具身智能·vla·世界模型·记忆机制·子任务
《VLA 系列》π0.7 | 多模态提示可控机器人基座模型 | 组合泛化与跨本体迁移 | 论文与复现思路π0.7 想解决的不是再做一个更大的 VLA,而是一个更棘手的数据问题:机器人数据一旦扩展到不同机器人、不同操作者、自动执行轨迹甚至失败样本,同一个任务会同时出现快慢不同、质量不同、策略不同的多种行为。若只给模型一句任务指令,模型很容易把这些模式平均在一起,学到一个哪种都不像的折中策略。
_张一凡1 个月前
机器人·具身智能·vla·世界模型
【论文解读】VLN-R1:让大视觉语言模型直接吃第一人称视频走出连续动作,用 GRPO 强化微调和时间衰减奖励把“导航“做成 LVLM 的可验证后训练任务论文:VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning(The University of Hong Kong / Shanghai AI Lab,arXiv 预印本,cs.CV) 发布时间:2025 年 6 月 20 日(arXiv v1) 作者:Zhangyang Qi、Zhixiong Zhang、Yizhou Yu、Jiaqi Wang、Hengshuang Zhao(共 5 人;Jiaqi Wang、Hengshua
chen_zn951 个月前
人工智能·具身智能·vla·世界模型·世界动作模型
《WAM 系列》Fast-WAM|视频共训练|跳过未来想象|实时WAMFast-WAM 基于 Wan2.2-5B 视频模型改造,采用 Video DiT + Action DiT 的双专家结构。核心思路是:训练时保留未来视频预测,推理时不再生成未来视频。论文用受控实验说明,WAM 的主要收益更可能来自训练阶段的视频共训练,而不是测试阶段显式生成未来画面。
yuhaiqun19891 个月前
人工智能·云计算·边缘计算·具身智能·世界模型·空间智能
AI往哪长|云计算·边缘计算·世界模型·空间智能·具身智能一次讲透📢 本文是 「108张AI知识卡片·大模型通关手册」 系列第 20 篇,也是常规长文的最后一篇。前面讲完工程化方法论与框架,这篇换个视角:AI 的能力边界正在往哪里扩。很多人觉得"大模型不就是更会聊天",殊不知真正的下一跳在云端之外——模型正在学怎么"想象现实"、“理解空间”、“长进身体”。这篇把 5 个前沿方向一次讲透——看完你能分清"算力底座"、“认知延伸”、“物理落地"这三层演进,而不是把"AI 前沿"笼统当成"更厉害的大模型”。
白拾1 个月前
世界模型·planet 论文分享·基于模型的强化学习·潜在空间规划·icml 2019
【ICML 2019】PlaNet:从像素中学习潜在动力学进行规划|从世界模型奠基视角本文解读 ICML 2019 论文《Learning Latent Dynamics for Planning from Pixels》(PlaNet,深度规划网络)。该论文提出从像素观测直接学习潜在动力学模型、并在潜在空间进行快速在线规划的纯基于模型强化学习框架,通过融合RSSM 双路径潜在状态模型、交叉熵方法(CEM)潜在空间规划与latent overshooting 多步预测训练,首次让基于模型的智能体在 6 类像素级连续控制任务上全面跑通,其特别之处在于规划全程不生成图像、只在潜在空间评估动作序
白拾1 个月前
具身智能·世界模型·jepa·jepa-vla 论文分享·vla 机器人·自监督表示·v-jepa2
【arXiv preprint 2026】JEPA-VLA:视频预测嵌入,为 VLA 补上缺失的视觉知识|从具身智能世界模型视角本文解读 arXiv preprint 2026 论文《JEPA-VLA: Video Predictive Embedding is Needed for VLA Models》(清华大学 THUML × 华为诺亚方舟实验室,通讯作者龙明盛)。该论文提出JEPA-VLA,通过把冻结的视频预测嵌入 V-JEPA2 接入现有视觉语言动作模型(VLA),同时补上环境理解与策略先验两种关键视觉知识,其特别之处在于只加一个线性投影或几个门控交叉注意力层、无需任何世界模型训练数据。实验表明LIBERO 平均成功率
_张一凡1 个月前
3d·具身智能·世界模型
【论文解读】一篇读懂LAWM-3D:从 DreamDojo 的 2D 潜动作到 3D 感知,关键不是加多视角而是三道防泄漏设计论文:LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models(Nankai University / Tsinghua University / Harbin Institute of Technology / EPFL,AAAI 2027) 发布时间:2026 年 8 月 6 日(arXiv v1) 作者:Jiarui Yang、Jiale Zhang、Jiawei