世界模型

RockHopper20253 天前
人工智能·系统架构·软件工程·ai编程·世界模型
AI时代模型生命周期与软件资产重构:概要版AI辅助开发正在降低理解需求、生成模型、调整实现和完成验证的成本。由此产生的问题不再只是开发效率,而是:软件体系是否仍然需要把特定场景、流程和应用结构作为长期不变的组织基础?
I Am a robert girl4 天前
学习·具身智能·持续学习·灾难性遗忘·机器人学习·世界模型·组合式基准
从零读懂世界模型的持续学习:一份组合式基准的源码级拆解从今天觉醒,技术赋予每一个人数字生命先抛一个面试里常被追问的问题:一个在世界模型里训练好的机器人,换了个新任务后为什么突然变笨了?
RockHopper20254 天前
人工智能·智能体·世界模型·工业数字化
面向工业现实的原生数字化工程框架概要说明工业数字化应当以工业现实及其演化机制为工程起点,建立能够共同理解状态、协调行动、验证结果的运行秩序。评价数字化的尺度,应落在系统能否在明确的责任、权限与约束下持续推进工业活动,并依据证据接受结果。
天涯明月19936 天前
大数据·人工智能·大模型·具身智能·世界模型
世界模型:原理、范式与工程实践从 Dreamer 到可编辑世界定位:技术书 + 选型手册。全文不限篇幅,每个技术判断标注证据强度,每个数字可追溯到一手来源。
深蓝学院7 天前
机器人·具身智能·世界模型
新加坡国立大学:Show‑Harness,一个接口,直接让VLM操控实体机器人设计一个恰当的接口,就能让现成的VLM直接、精细地操控机器人。——接口即能力目录01 Show‑Harness核心系统设计:语义动作接口 + 模块化插件 + GUMI数据采集
做cv的小昊10 天前
人工智能·算法·机器学习·大模型·多模态·vla·世界模型
【World Model】π0.5:a Vision-Language-Action Model with Open-World Generalization图1: π 0.5 \pi_{0.5} π0.5 模型从多种异质数据源中迁移知识,包括其他机器人、高层子任务预测、口头指令和网络数据,从而实现跨环境和物体的广泛泛化。 π 0.5 \pi_{0.5} π0.5 能够控制移动操作机器人,在训练数据未覆盖的新家庭中清洁厨房和卧室,并执行持续10至15分钟的复杂多阶段行为。
深蓝学院18 天前
机器人·具身智能·vla·世界模型
六大具身路线详解:模块化、技能编排、IL、RL、VLA、世界模型,到底在“吵”什么。。。目录01 模块化规划:先弄明白,机器人为什么总喜欢“拆开做”🚩2021年 MIT 团队发表的 Integrated Task and Motion Planning(TAMP),就是理解这类问题非常好的入口。
audyxiao00120 天前
iclr·论文分享·世界模型·机器人策略
人工智能顶会ICLR 2026论文分享|Ctrl-World:让机器人策略在想象空间中完成评估与改进机器人学习领域一直有个核心难题,如何在不依赖大量真实机器人rollout的情况下,判断通用机器人策略是否真正理解了指令,并进一步利用这些经验提升策略在陌生物体和新任务上的表现。真实世界中的策略评估通常需要反复执行任务,研究者不仅要准备不同的物体、场景和相机位置,还需要通过多次实验获得具有统计意义的结果。当策略在某类任务上失败时,后续改进往往还需要重新采集专家示范数据。这个过程成本较高,也限制了通用机器人策略的迭代速度。近期,来自斯坦福大学和清华大学的研究团队在ICLR 2026上提出Ctrl-World,
东姬AI23 天前
多模态·ai数字人·世界模型·ai视频生成·音画同步
当世界模型学会“开口说话“:从EchoWM开源,看AI生成内容的音画合流过去两年,AI视频生成的进步几乎都发生在"画面"上:分辨率从480P卷到1080P,时长从几秒卷到几十秒,物理规律和运镜质感也在肉眼可见地逼近实拍。但有一个维度长期被搁置在次要位置——声音。绝大多数视频生成模型产出的内容是"默片",配音、音效、环境声要靠后期另外补。9月初的京东全球科技探索者大会(JDD)上,京东探索研究院开源的交互视听世界模型EchoWM,把这个问题重新推到了台前:它生成的不是"带画面的视频",而是画面、环境音、音乐和语音原生同步的视听内容,并且允许用户像玩游戏一样走进去持续探索。
白拾1 个月前
机器人操作·视频生成·世界模型·arxiv 2026·abot-physworld 论文分享·物理推理
【arXiv 2026】ABot-PhysWorld 论文解读:物理对齐的交互式世界基础模型|从视频生成物理AI评测视角本文解读 arXiv 2026 论文《ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment》。该论文提出 ABot-PhysWorld 物理对齐交互式世界模型,通过融合物理感知数据管护、解耦判别器 Diffusion-DPO 对齐与零初始化动作注入,让 14B Diffusion Transformer 生成物理可信、动作可控的机器人操纵视频,其特别之处在于用"出
ergevv1 个月前
卡尔曼滤波·预测·世界模型·rssm
RSSM 与卡尔曼滤波:相似的思想,不同的世界模型第一次看到 RSSM(Recurrent State-Space Model,循环状态空间模型)时,会产生一个很自然的感觉:它和卡尔曼滤波都在“根据过去预测现在,再用新观测修正预测”。这个感觉是对的,但还不够精确。
deepseek231 个月前
具身智能·vla·世界模型·机器人基础模型·多机器人协作
芝诺 Zeno-1 去中心化协作具身基础模型拆解:3B 参数把多机器人协作写进单一策略,CPI 闭环训练与行动条件世界模型如何预警接触失败给两台工业机械臂设计协作系统,最直觉的思路是先让它们互相商量。谁先抬哪头,谁后发力,顺序写进通信协议里,两台照章执行就行。可机械车间里根本没有这么干净的剧本,钢珠会在托盘上滑动。光源会让相机偏转,协议里写死的理想状态,一到真实环境就全部失效。
HyperAI超神经1 个月前
人工智能·深度学习·机器人·英伟达·世界模型
机器人运动误差降低90.4%,英伟达/哈佛等提出Hydra-0,用Action Flow统一世界建模与控制如果说大模型正在让机器「理解语言」,那么世界模型(World Model)试图解决的,则是让机器真正理解一个更复杂的问题:做出一个动作之后,现实世界会发生什么?
feasibility.1 个月前
人工智能·aigc·视频·地图·具身智能·英伟达·世界模型
ABot-World-0:当一块 RTX 5090 能编织无限世界——交互式世界模型的高德解法一句话总结:高德 AMAP CV Lab 用一张 RTX 5090,把“无限交互世界”从数据中心的幻想拉进了你的桌面机箱。5B 参数的因果学生模型,基于 Wan2.2 骨干,经三阶段渐进蒸馏(Teacher Forcing → ODE Distillation → LongForcing),在 720P/16FPS/1.2s 延迟/~19GB 显存的约束下,实现了小时级甚至日级不崩溃的闭环交互世界 rollout。
luckystar513~1 个月前
世界模型·李飞飞·atlas世界模型
如何看待,李飞飞的世界模型AtLas【生成、重建和时空建模三统一】李飞飞团队今日发布的Atlas,确实可以被视为AI发展历程中的一个重要节点。它不再满足于生成平面的图像或视频,而是旨在构建一个可交互、可度量的三维世界。作为一个“多模态自回归扩散Transformer”,Atlas的核心突破在于将空间智能(Spatial Intelligence)从理论推向了工程实践。
音视频牛哥1 个月前
人工智能·具身智能·世界模型·world model·vla模型·多模态感知·机器人决策
世界模型如何重塑具身智能:从VLA到预测式机器人控制围绕“世界模型是不是机器人下一个奇点时刻”的讨论正在升温。过去几年,具身智能的发展重点集中在大模型、VLA(Vision-Language-Action)、模仿学习和遥操作数据上:让机器人看懂场景、理解语言,并根据输入直接生成动作。如今,行业开始把更多注意力转向世界模型,因为仅仅知道“应该做什么”,并不等于能够判断“做完以后世界会发生什么”。
七77.1 个月前
3d·agent·世界模型
SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation原文链接:https://arxiv.org/pdf/2603.12238 源码链接:https://github.com/ROUJINN/SceneAssistant
thesky1234562 个月前
大模型·视频生成·sora·世界模型·jepa·生成式世界模型·dreamer
27届大模型面试准备(四十四):生成式世界模型与视频生成——从 JEPA 到 Sora/GenieA40 讲了多模态大模型怎么把视觉编码器、投影器、图文对齐训在一起;A31 讲了多模态推理与视觉思维链。本篇再往前走一步,进入世界模型(World Model)——不只是"看懂一张图、答好一道题",而是让模型内部建模世界的动态规律:给定当前状态与一个动作/条件,能预测下一刻会发生什么。这是视频生成、具身智能、自动驾驶的共同底层,也是 2024–2026 最热的研究前沿。面试里能把它和"多模态理解"区分开,并讲清 JEPA、Dreamer、Sora、Genie 各自的范式,是拉开差距的关键。
猫先生Mr.Mao2 个月前
论文解读·具身智能·vla·机器人学习·世界模型
具身智能之UniJEPA详解:让机器人同时“听懂、预见、动起来”的统一表征学习【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
杀生丸学AI2 个月前
人工智能·深度学习·3d·数据挖掘·transformer·世界模型·高斯泼溅
【世界模型】Lyra 2.0:可探索的生成式3D世界(NVIDIA)图1:Lyra 2.0能够基于单张图像实现长视距的三维一致性场景生成。用户可从输入图像出发,通过迭代定义相机运动来探索场景;与此同时,Lyra 2.0会合成具有空间持续性的视频输出,逐步扩展场景环境。这些视频可直接重构为高保真3DGS与表面网格,从而生成可在仿真引擎及交互式查看器中部署的3D资产。