世界模型

白拾3 小时前
世界模型·planet 论文分享·基于模型的强化学习·潜在空间规划·icml 2019
【ICML 2019】PlaNet:从像素中学习潜在动力学进行规划|从世界模型奠基视角本文解读 ICML 2019 论文《Learning Latent Dynamics for Planning from Pixels》(PlaNet,深度规划网络)。该论文提出从像素观测直接学习潜在动力学模型、并在潜在空间进行快速在线规划的纯基于模型强化学习框架,通过融合RSSM 双路径潜在状态模型、交叉熵方法(CEM)潜在空间规划与latent overshooting 多步预测训练,首次让基于模型的智能体在 6 类像素级连续控制任务上全面跑通,其特别之处在于规划全程不生成图像、只在潜在空间评估动作序
白拾3 天前
具身智能·世界模型·jepa·jepa-vla 论文分享·vla 机器人·自监督表示·v-jepa2
【arXiv preprint 2026】JEPA-VLA:视频预测嵌入,为 VLA 补上缺失的视觉知识|从具身智能世界模型视角本文解读 arXiv preprint 2026 论文《JEPA-VLA: Video Predictive Embedding is Needed for VLA Models》(清华大学 THUML × 华为诺亚方舟实验室,通讯作者龙明盛)。该论文提出JEPA-VLA,通过把冻结的视频预测嵌入 V-JEPA2 接入现有视觉语言动作模型(VLA),同时补上环境理解与策略先验两种关键视觉知识,其特别之处在于只加一个线性投影或几个门控交叉注意力层、无需任何世界模型训练数据。实验表明LIBERO 平均成功率
_张一凡1 天前
3d·具身智能·世界模型
【论文解读】一篇读懂LAWM-3D:从 DreamDojo 的 2D 潜动作到 3D 感知,关键不是加多视角而是三道防泄漏设计论文:LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models(Nankai University / Tsinghua University / Harbin Institute of Technology / EPFL,AAAI 2027) 发布时间:2026 年 8 月 6 日(arXiv v1) 作者:Jiarui Yang、Jiale Zhang、Jiawei
白拾4 天前
扩散模型·世界模型·模仿学习·rss 2025·uwm 论文分享·机器人预训练
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角本文解读 RSS 2025 论文《Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets》。该论文提出统一世界模型(UWM),通过融合动作扩散、未来观测视频扩散与独立扩散时间步设计,让同一个扩散 Transformer 同时充当策略、前向动力学、逆动力学与视频预测四种模型,其特别之处在于用噪声水平统一了 conditioning 与 marginalization
带娃的IT创业者4 天前
github·世界模型·规范驱动开发·机器人开发·开源协作·物理智能
Spec-Kit 与物理智能的范式跃迁:当 GitHub 成为世界模型的协作基础设施👋 Hi,我热衷于 (AI 大模型应用落地、Python 实战进阶与 AI 开发工具链)。代表专栏:《AI大模型应知应会短平快系列100篇》《解密OpenClaw》《解码意识NCTransformer》《WeClaw Agent实战》> 💡 创业路上,用技术换时间;欢迎 关注我,一起把 AI 变成生产力 🚀 >
猫先生Mr.Mao4 天前
多模态·论文解读·3dgs·世界模型
世界模型之HY-World 2.0详解:生成完还能走进去——如何把文本、照片和视频变成可探索的 3D 世界【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
旋生万物8 天前
人工智能·python·算法·机器学习·copilot·世界模型·物理ai
电磁力 = 螺旋联络的 90° 旋转?麦克斯韦方程组的几何重构2026-08-01 06:00 晨间深度:周六早 6 点,适合把“电”和“磁”拧成一股绳。昨天我们聊了引力是万物自旋的合力,今天把目光拉近到电磁相互作用。麦克斯韦方程组被誉为“物理学的诗”,但它依旧是 4 个分离的偏微分方程。在螺旋生成论(SGT)中,这 4 个方程可以被统一成一个几何命题:电磁力是螺旋数域 CN 中联络的 90° 旋转(π/2 相位跃迁)。本文基于《螺旋代数几何》与《旋生万物》,给出电磁统一的螺旋算子推导,并附可运行的“电磁波螺旋传播”可视化代码。
ergevv9 天前
机器人·vla·世界模型·空间智能·认知地图
从大模型到空间智能:未来机器人的终极架构畅想过去几十年,机器人技术一直在追求一个目标:让机器像人一样感知世界、理解世界,并在世界中自主行动。然而,传统机器人距离这个目标始终存在巨大鸿沟。
一颗小树x14 天前
机器人·指南·操作·vla·世界模型
机器人世界模型:2026 技术全景与工程选型指南前言:2026 年的机器人世界模型已分化成四条技术路线——视频生成、潜空间预测(JEPA)、3D 空间智能与具身操作。闭源旗舰(Sora 2、Genie 3、Marble、GR-2)定义能力上限,开源栈(Cosmos、V-JEPA 2、RynnVLA-002、HunyuanWorld)已覆盖绝大多数工程环节。物理保真是全行业短板,而工程终局不是单一路线胜出,而是「神经仿真器 + 显式物理引擎 + 潜空间规划」的分层混合架构。
武子康22 天前
人工智能·ai·chatgpt·openai·claude·世界模型·视频模型
2026 开源视频生成模型全景图:按 9 类任务路由比按参数量选模型更可靠开源视频生成已经不是“找一个文生视频模型”这么简单。到 2026 年,公开权重覆盖了文本生成视频、首帧驱动、多参考图、视频续写、角色动作迁移、音频驱动人物、音视频联合生成和具身世界建模。模型之间真正的差别,不只是画面是否漂亮,而是它接受什么条件、能控制什么、需要什么硬件,以及能否进入稳定生产链路。
龙腾亚太1 个月前
人工智能·具身智能·世界模型·ai落地·物理ai·物理神经网络
物理AI:打破虚拟边界,解锁AI落地物理世界的下一代革命如今大模型、RAG、AI智能体技术飞速普及,但绝大多数AI始终局限在文本、图像、代码的虚拟数字场景。这类AI擅长语义对话、内容生成、逻辑梳理,却完全缺失真实世界的物理常识:不懂重力下落、无法预判碰撞轨迹、不理解摩擦与力学变化,难以适配复杂动态的真实环境。这也是通用大模型“聊天无敌”,却始终难以落地机器人、自动驾驶、工业控制、智能装备等实体产业的核心症结。
君为先-bey2 个月前
transformer·扩散模型·导航·具身智能·世界模型·条件扩散
NWM----导航世界模型论文标题Navigation World Models作者Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, Yann LeCun
alun5502 个月前
高德·世界模型·谷歌地球
高德地球-ABot-Earth 0.5Lun.A, 2026.06.10“高德地球”是我自己这么叫,官方没这么叫,后文我均以“高德地球”为名替代官方名称,官方地址
vivo互联网技术2 个月前
ai·aigc技术探索·世界模型·影像
MagicWorld 实现长时交互视频世界建模论文主页:MagicWorld: Towards Long-Horizon Stability for Interactive Video World Exploration
传说故事2 个月前
论文阅读·人工智能·具身智能·世界模型
【论文阅读】WorldArena 2.0:扩展具身世界模型在模态性、功能性与平台上的基准测试通过把评测标准从“光看视频像不像”升级到“多模态感知+真动手干活+现实世界测试”,逼出真正能用的具身世界模型。
七77.2 个月前
3d·世界模型
【3D 场景生成】NuiScene: Exploring Efficient Generation of Unbounded Outdoor Scenes源码链接:https://3dlg-hcvc.github.io/NuiScene/ 发表:ICCV-2025
七77.2 个月前
3d·世界模型
【3D 场景生成】WorldGen: From Text to Traversable and Interactive 3D Worlds原文链接:https://openaccess.thecvf.com/content/CVPR2026/papers/Wang_WorldGen_From_Text_to_Traversable_and_Interactive_3D_Worlds_CVPR_2026_paper.pdf video:https://www.meta.com/blog/worldgen-3d-world-generation-reality-labs-generative-ai-research/ 发表:CVPR-2026
七77.2 个月前
世界模型
【视频世界模型】InSpatio-WorldFM: An Open-Source Real-Time Generative Frame Model原文链接:https://inspatio.github.io/worldfm/本文提出 InSpatio-WorldFM,一款面向空间智能的开源实时帧模型。现有基于视频的世界模型依赖序列帧生成,窗口级处理会带来较大延迟;与之不同,InSpatio-WorldFM 采用基于帧的范式,每一帧均可独立生成,能够实现低延迟的实时空间推理。该模型通过显式三维锚点与隐式空间记忆约束多视角空间一致性,在视角发生变化时,既能保证全局场景几何结构稳定,又能保留精细视觉细节。本文进一步设计了一套渐进式三阶段训练流程:先将预
audyxiao0012 个月前
大数据·人工智能·大模型·智能体·世界模型
ICLR 2026论文分享 | WorldGym:用世界模型打造机器人策略评估新范式本文介绍了ICLR 2026的论文《WorldGym: World Model as an Environment for Policy Evaluation》。该论文提出了一种基于视频世界模型的机器人策略评估平台WorldGym。该框架能够仅通过单张初始图像,在生成的虚拟环境中完成机器人策略的全流程评估。WorldGym的架构如图1所示。首先,给定初始帧和语言指令,世界模型根据策略输出的动作序列交互式预测未来帧,作为生成式模拟器;随后,通过视觉语言模型(Visual Language Model,VLM