具身智能

大江东去浪淘尽千古风流人物9 小时前
机器人·transformer·具身智能·机器人学习·视觉表示·patch policy·robodojo
【RoboDojo】机器人操作通用策略统一评估基准:42仿真+18现实任务×异构并行深度解析通用机器人操作策略发展迅速,但现有基准在系统性评估上存在局限——任务简单、短序列、能力覆盖窄,且仅在仿真或仅在现实中进行。仿真评估可扩展但缺失物理部署挑战,现实评估成本高、耗时且难以复现。RoboDojo 提出统一的仿真-现实评估基准,包含 42 个仿真任务和 18 个现实任务,覆盖五大能力维度(泛化、记忆、精度、长序列、开放式),通过 Isaac Sim 异构并行仿真实现可扩展反馈,通过 RoboDojo-RealEval 提供可复现的现实评估系统(云端访问、标准化硬件、场景重置、评估协议)。配合 XP
AIGCmagic社区1 天前
人工智能·具身智能·ai多模态
10个数据集143万段视频统一成一份契约,SolarWM世界模型开源数据引擎拆读《三年面试五年模拟》AIGC / LLM / AI Agent 算法工程师与开发工程师求职面试秘籍,独家资源见 WeThinkIn/AIGC-Interview-Book,欢迎 Star!
AIGCmagic社区2 天前
人工智能·aigc·具身智能·ai多模态
Show-Harness拆读,语义动作单元让VLM直接控机械臂,零样本跨任务89%《三年面试五年模拟》AIGC / LLM / AI Agent 算法工程师与开发工程师求职面试秘籍,独家资源见 WeThinkIn/AIGC-Interview-Book,欢迎 Star!
Robot_Nav3 天前
具身智能·vla·vlm
前沿 | VLA 演进:从动作 Token 到分层具身智能体论文:Zitkovich et al., RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control, CoRL 2023。 论文:Black et al., π₀: A Vision-Language-Action Flow Model for General Robot Control, RSS 2025。 论文:Pertsch et al., FAST: Efficient Action Tokeniza
feasibility.4 天前
ai·机器人·无人机·导航·具身智能·vla·vln
当“给机器人指路“成为一门数据工程学——SimpleNav 拆解:导航大模型的标准化之争一个场景:你想让无人机听懂"飞到那座红色屋顶的左边,绕过塔吊,停在空地上"。 三年前,这需要为一个数据集写一套数据解析、为一个仿真器写一套接口、为一个模型写一套评测脚本。2026 年,清华 THUNLP 联合 OpenBMB 等机构开源的 SimpleNav 说:这套东西应该只需要写一次。
_张一凡5 天前
具身智能·行业周报
2026年9月具身智能行业资讯周报(9月07日-9月13日)写在前面: 社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~ AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设! AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智
Mininglamp_27185 天前
人工智能·agent·多智能体·具身智能
MCP和A2A之后,机器人网络里还缺一层开放通信协议过去两年数字 Agent 世界发生了两件确立标准的事。Anthropic 在 2024 年底发布 Model Context Protocol(MCP),定义了 Agent 怎么标准化地调用外部工具和数据源;Google 在 2025 年发布 Agent2Agent Protocol(A2A),定义了不同厂商、不同框架构建的 Agent 之间怎么互相通信协作。这两层协议加起来,数字世界里"Agent 怎么连接工具、怎么和别的 Agent 对话"基本有了公共答案,不需要每接一个新工具或者新 Agent 就重
大江东去浪淘尽千古风流人物5 天前
机器人·transformer·具身智能·机器人学习·视觉表示·patch policy
【Patch Policy】稠密视觉表示驱动的轻量级机器人策略深度解析机器人策略常把一帧图像压缩成 CLS token 或全局平均池化向量,虽然计算方便,却容易丢失插孔、边缘、接触点等精细空间信息;直接使用 patch token 的视觉语言动作模型又往往背负数十亿参数。论文《Patch Policy: Efficient Embodied Control via Dense Visual Representations》提出一个更轻量的中间方案:冻结预训练 Vision Transformer,保留每帧的 dense patch features,并用 block-cau
_张一凡5 天前
机器人·具身智能·vla
【论文解读】 一篇读懂VLA具身推理诊断基准RoboSPA:从细粒度空间消歧到长程程序规划,五级难度把VLA量到“不如随机猜“写在前面: 社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~ AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设! AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智
陈天伟教授5 天前
人工智能·windows·具身智能
具身数据采集黑话(4)采集系统可能记录以下内容:图像、深度图和点云:描述环境外观与几何。关节角(joint angles):描述关节状态;目标关节角可以作为动作,但当前读数不自动等于动作标签。
_张一凡5 天前
aigc·具身智能·面试面经
【AIGC面试面经第12期】具身智能算法工程师面试面经相关问题汇总写在前面: 社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~ AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设! AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智
行如流水6 天前
具身智能
自进化来了,Zeva:面向泛化具身操作的上下文因果学习论文:Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
VL——MOESR7 天前
论文阅读·人工智能·机器学习·具身智能·cosmospolicy
【具身智能】Cosmos Policy论文阅读随笔Cosmos Policy 构建于 Cosmos-Predict2(一种视频模型)之上,通过其海量互联网视频预训练的基础,使得模型能够处理机器人任务。
deepseek238 天前
机器人·具身智能·ai agent·京东·物理智能
京东 JoyAI 物理基座模型 PhysBrain 1.5 发布拆解:8B 参数如何通过人类学习范式拿下开源第一,媲美 GPT-6 Astra2026年9月10日,京东探索研究院正式发布物理基座模型PhysBrain 1.5。这款8B参数的开源模型在58项真人盲评中拿下开源第一。
deepseek239 天前
具身智能·vla·世界模型·机器人基础模型·多机器人协作
芝诺 Zeno-1 去中心化协作具身基础模型拆解:3B 参数把多机器人协作写进单一策略,CPI 闭环训练与行动条件世界模型如何预警接触失败给两台工业机械臂设计协作系统,最直觉的思路是先让它们互相商量。谁先抬哪头,谁后发力,顺序写进通信协议里,两台照章执行就行。可机械车间里根本没有这么干净的剧本,钢珠会在托盘上滑动。光源会让相机偏转,协议里写死的理想状态,一到真实环境就全部失效。
_张一凡9 天前
具身智能
【论文解析】一篇读懂异步在线 RL:从动作块三分区到梯度截断,SmoothRL 让值梯度只流向真正执行的动作写在前面: 社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~ AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设! AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智
智能体与具身智能10 天前
人工智能·python·具身智能
TVA具身智能的概念、架构与应用(19)前沿技术探索:AI智能体视觉(TVA,Transformer-based Vision Agent)是依托Transformer架构与“因式智能体”理论所构建的颠覆性工业视觉技术,是集深度强化学习(DRL)、卷积神经网络(CNN)、因式分解算法(FRA)于一体的具身智能视觉中枢(www.tianyance.cn)。它基于非结构化的动态视觉理解,超越固定规则和传统视觉范式,构建了“感知-推理-决策-操作-反馈”的迭代运作闭环,实现从“看见”到“看懂并行动”的机器学习范式突破(SciML),不仅被业界誉为“A
_张一凡10 天前
具身智能·vla
【论文解读】一篇读懂 VLA 模态纠缠:从证据打分到双铰链一致性损失,零推理开销让策略只信该信的传感器写在前面: 社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~ AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设! AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智
正在走向自律11 天前
人工智能·机器人·具身智能·人形机器人·机器人运动会·百米竞速
爆火全网的2026机器人运动会:从赛场竞速到具身智能产业化的技术全解析2026年盛夏,一场特殊的竞技盛会刷屏全网、引爆舆论焦点——第二届世界人形机器人运动会在北京“冰丝带”盛大举办,2056台各类机器人同台竞技,666支全球顶尖科研与产业队伍展开巅峰对决,51个细分赛项、1301场竞技赛事,彻底打破了大众对机器人“呆板、缓慢、程序化”的固有认知。百米冲刺超越人类世界纪录、乒乓球全自主对打精准博弈、高难度街舞流畅演绎、长距离耐力跑稳定续航、多机协同阵型变幻自如,一系列震撼名场面让这场机器人盛会成为年度科技顶流。
FII工业富联科技服务11 天前
大数据·人工智能·深度学习·机器学习·机器人·制造·具身智能
Omniverse + Isaac Teleop + 合成数据:工业富联机器人大脑训练+执行落地闭环拆解摘要传统工业机器人依靠固定程序完成任务,适合标准化、高重复场景,但在产品换型、工艺调整和复杂工位中适应能力不足。具身智能机器人要进入制造现场,必须从“执行程序”升级为“通过训练获得任务经验”。本文以工业富联为例,拆解其背后的技术路径:基于 NVIDIA Omniverse 构建数字孪生工厂,通过 Isaac Teleop 采集人类示范数据,再结合合成数据和强化学习进行大规模训练,最终通过边缘服务器下发技能模型,实现物料搬运、外观质检和精密装配等任务的快速切换。