Gemini Robotics将AI带入物理世界
谷歌DeepMind正式推出基于Gemini 2.0的两款机器人AI模型:
- Gemini Robotics:先进的视觉-语言-动作(VLA)模型,新增物理动作输出模态,可直接控制机器人
- Gemini Robotics-ER:具备空间理解能力的增强模型,支持开发者调用其具身推理(ER)能力
核心技术突破
通用性
- 利用Gemini的世界理解能力处理未见过的任务/物体/环境
- 在泛化基准测试中性能达到其他SOTA模型的两倍以上
交互性
- 基于Gemini 2.0的自然语言理解
- 支持多语言即时指令响应
- 实时环境监测与动态调整能力
灵巧性
- 完成折纸、食品包装等精细操作
- 支持多步骤复杂任务执行
多形态适配
- 兼容ALOHA 2双臂平台
- 适配Franka机械臂
- 正在开发人形机器人Apollo的专用版本
安全架构
- 底层运动控制安全机制(防碰撞/接触力限制)
- 高层语义安全理解
- 发布ASIMOV数据集推进安全研究
- 采用数据驱动的"机器人宪法"框架
合作伙伴
- Apptronik(人形机器人开发)
- 波士顿动力等机构参与测试
更多精彩内容 请关注我的个人公众号 公众号(办公AI智能小助手)
公众号二维码