世界模型

七77.8 小时前
3d·agent·世界模型
SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation原文链接:https://arxiv.org/pdf/2603.12238 源码链接:https://github.com/ROUJINN/SceneAssistant
thesky1234569 天前
大模型·视频生成·sora·世界模型·jepa·生成式世界模型·dreamer
27届大模型面试准备(四十四):生成式世界模型与视频生成——从 JEPA 到 Sora/GenieA40 讲了多模态大模型怎么把视觉编码器、投影器、图文对齐训在一起;A31 讲了多模态推理与视觉思维链。本篇再往前走一步,进入世界模型(World Model)——不只是"看懂一张图、答好一道题",而是让模型内部建模世界的动态规律:给定当前状态与一个动作/条件,能预测下一刻会发生什么。这是视频生成、具身智能、自动驾驶的共同底层,也是 2024–2026 最热的研究前沿。面试里能把它和"多模态理解"区分开,并讲清 JEPA、Dreamer、Sora、Genie 各自的范式,是拉开差距的关键。
猫先生Mr.Mao10 天前
论文解读·具身智能·vla·机器人学习·世界模型
具身智能之UniJEPA详解:让机器人同时“听懂、预见、动起来”的统一表征学习【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
杀生丸学AI11 天前
人工智能·深度学习·3d·数据挖掘·transformer·世界模型·高斯泼溅
【世界模型】Lyra 2.0:可探索的生成式3D世界(NVIDIA)图1:Lyra 2.0能够基于单张图像实现长视距的三维一致性场景生成。用户可从输入图像出发,通过迭代定义相机运动来探索场景;与此同时,Lyra 2.0会合成具有空间持续性的视频输出,逐步扩展场景环境。这些视频可直接重构为高保真3DGS与表面网格,从而生成可在仿真引擎及交互式查看器中部署的3D资产。
chen_zn9513 天前
具身智能·vla·世界模型·记忆机制·子任务
《VLA 系列》π0.7 | 多模态提示可控机器人基座模型 | 组合泛化与跨本体迁移 | 论文与复现思路π0.7 想解决的不是再做一个更大的 VLA,而是一个更棘手的数据问题:机器人数据一旦扩展到不同机器人、不同操作者、自动执行轨迹甚至失败样本,同一个任务会同时出现快慢不同、质量不同、策略不同的多种行为。若只给模型一句任务指令,模型很容易把这些模式平均在一起,学到一个哪种都不像的折中策略。
_张一凡13 天前
机器人·具身智能·vla·世界模型
【论文解读】VLN-R1:让大视觉语言模型直接吃第一人称视频走出连续动作,用 GRPO 强化微调和时间衰减奖励把“导航“做成 LVLM 的可验证后训练任务论文:VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning(The University of Hong Kong / Shanghai AI Lab,arXiv 预印本,cs.CV) 发布时间:2025 年 6 月 20 日(arXiv v1) 作者:Zhangyang Qi、Zhixiong Zhang、Yizhou Yu、Jiaqi Wang、Hengshuang Zhao(共 5 人;Jiaqi Wang、Hengshua
chen_zn9516 天前
人工智能·具身智能·vla·世界模型·世界动作模型
《WAM 系列》Fast-WAM|视频共训练|跳过未来想象|实时WAMFast-WAM 基于 Wan2.2-5B 视频模型改造,采用 Video DiT + Action DiT 的双专家结构。核心思路是:训练时保留未来视频预测,推理时不再生成未来视频。论文用受控实验说明,WAM 的主要收益更可能来自训练阶段的视频共训练,而不是测试阶段显式生成未来画面。
yuhaiqun198916 天前
人工智能·云计算·边缘计算·具身智能·世界模型·空间智能
AI往哪长|云计算·边缘计算·世界模型·空间智能·具身智能一次讲透📢 本文是 「108张AI知识卡片·大模型通关手册」 系列第 20 篇,也是常规长文的最后一篇。前面讲完工程化方法论与框架,这篇换个视角:AI 的能力边界正在往哪里扩。很多人觉得"大模型不就是更会聊天",殊不知真正的下一跳在云端之外——模型正在学怎么"想象现实"、“理解空间”、“长进身体”。这篇把 5 个前沿方向一次讲透——看完你能分清"算力底座"、“认知延伸”、“物理落地"这三层演进,而不是把"AI 前沿"笼统当成"更厉害的大模型”。
白拾20 天前
世界模型·planet 论文分享·基于模型的强化学习·潜在空间规划·icml 2019
【ICML 2019】PlaNet:从像素中学习潜在动力学进行规划|从世界模型奠基视角本文解读 ICML 2019 论文《Learning Latent Dynamics for Planning from Pixels》(PlaNet,深度规划网络)。该论文提出从像素观测直接学习潜在动力学模型、并在潜在空间进行快速在线规划的纯基于模型强化学习框架,通过融合RSSM 双路径潜在状态模型、交叉熵方法(CEM)潜在空间规划与latent overshooting 多步预测训练,首次让基于模型的智能体在 6 类像素级连续控制任务上全面跑通,其特别之处在于规划全程不生成图像、只在潜在空间评估动作序
白拾23 天前
具身智能·世界模型·jepa·jepa-vla 论文分享·vla 机器人·自监督表示·v-jepa2
【arXiv preprint 2026】JEPA-VLA:视频预测嵌入,为 VLA 补上缺失的视觉知识|从具身智能世界模型视角本文解读 arXiv preprint 2026 论文《JEPA-VLA: Video Predictive Embedding is Needed for VLA Models》(清华大学 THUML × 华为诺亚方舟实验室,通讯作者龙明盛)。该论文提出JEPA-VLA,通过把冻结的视频预测嵌入 V-JEPA2 接入现有视觉语言动作模型(VLA),同时补上环境理解与策略先验两种关键视觉知识,其特别之处在于只加一个线性投影或几个门控交叉注意力层、无需任何世界模型训练数据。实验表明LIBERO 平均成功率
_张一凡21 天前
3d·具身智能·世界模型
【论文解读】一篇读懂LAWM-3D:从 DreamDojo 的 2D 潜动作到 3D 感知,关键不是加多视角而是三道防泄漏设计论文:LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models(Nankai University / Tsinghua University / Harbin Institute of Technology / EPFL,AAAI 2027) 发布时间:2026 年 8 月 6 日(arXiv v1) 作者:Jiarui Yang、Jiale Zhang、Jiawei
白拾24 天前
扩散模型·世界模型·模仿学习·rss 2025·uwm 论文分享·机器人预训练
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角本文解读 RSS 2025 论文《Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets》。该论文提出统一世界模型(UWM),通过融合动作扩散、未来观测视频扩散与独立扩散时间步设计,让同一个扩散 Transformer 同时充当策略、前向动力学、逆动力学与视频预测四种模型,其特别之处在于用噪声水平统一了 conditioning 与 marginalization
带娃的IT创业者24 天前
github·世界模型·规范驱动开发·机器人开发·开源协作·物理智能
Spec-Kit 与物理智能的范式跃迁:当 GitHub 成为世界模型的协作基础设施👋 Hi,我热衷于 (AI 大模型应用落地、Python 实战进阶与 AI 开发工具链)。代表专栏:《AI大模型应知应会短平快系列100篇》《解密OpenClaw》《解码意识NCTransformer》《WeClaw Agent实战》> 💡 创业路上,用技术换时间;欢迎 关注我,一起把 AI 变成生产力 🚀 >
猫先生Mr.Mao24 天前
多模态·论文解读·3dgs·世界模型
世界模型之HY-World 2.0详解:生成完还能走进去——如何把文本、照片和视频变成可探索的 3D 世界【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
旋生万物1 个月前
人工智能·python·算法·机器学习·copilot·世界模型·物理ai
电磁力 = 螺旋联络的 90° 旋转?麦克斯韦方程组的几何重构2026-08-01 06:00 晨间深度:周六早 6 点,适合把“电”和“磁”拧成一股绳。昨天我们聊了引力是万物自旋的合力,今天把目光拉近到电磁相互作用。麦克斯韦方程组被誉为“物理学的诗”,但它依旧是 4 个分离的偏微分方程。在螺旋生成论(SGT)中,这 4 个方程可以被统一成一个几何命题:电磁力是螺旋数域 CN 中联络的 90° 旋转(π/2 相位跃迁)。本文基于《螺旋代数几何》与《旋生万物》,给出电磁统一的螺旋算子推导,并附可运行的“电磁波螺旋传播”可视化代码。
ergevv1 个月前
机器人·vla·世界模型·空间智能·认知地图
从大模型到空间智能:未来机器人的终极架构畅想过去几十年,机器人技术一直在追求一个目标:让机器像人一样感知世界、理解世界,并在世界中自主行动。然而,传统机器人距离这个目标始终存在巨大鸿沟。
一颗小树x1 个月前
机器人·指南·操作·vla·世界模型
机器人世界模型:2026 技术全景与工程选型指南前言:2026 年的机器人世界模型已分化成四条技术路线——视频生成、潜空间预测(JEPA)、3D 空间智能与具身操作。闭源旗舰(Sora 2、Genie 3、Marble、GR-2)定义能力上限,开源栈(Cosmos、V-JEPA 2、RynnVLA-002、HunyuanWorld)已覆盖绝大多数工程环节。物理保真是全行业短板,而工程终局不是单一路线胜出,而是「神经仿真器 + 显式物理引擎 + 潜空间规划」的分层混合架构。
武子康1 个月前
人工智能·ai·chatgpt·openai·claude·世界模型·视频模型
2026 开源视频生成模型全景图:按 9 类任务路由比按参数量选模型更可靠开源视频生成已经不是“找一个文生视频模型”这么简单。到 2026 年,公开权重覆盖了文本生成视频、首帧驱动、多参考图、视频续写、角色动作迁移、音频驱动人物、音视频联合生成和具身世界建模。模型之间真正的差别,不只是画面是否漂亮,而是它接受什么条件、能控制什么、需要什么硬件,以及能否进入稳定生产链路。
龙腾亚太2 个月前
人工智能·具身智能·世界模型·ai落地·物理ai·物理神经网络
物理AI:打破虚拟边界,解锁AI落地物理世界的下一代革命如今大模型、RAG、AI智能体技术飞速普及,但绝大多数AI始终局限在文本、图像、代码的虚拟数字场景。这类AI擅长语义对话、内容生成、逻辑梳理,却完全缺失真实世界的物理常识:不懂重力下落、无法预判碰撞轨迹、不理解摩擦与力学变化,难以适配复杂动态的真实环境。这也是通用大模型“聊天无敌”,却始终难以落地机器人、自动驾驶、工业控制、智能装备等实体产业的核心症结。