"人机环交互的具身智能系统"可理解为:智能体有物理本体,在**人(操作者/协作者)---机器人(本体/多机)---环境(物体、产线、空间、物理规律)**三者持续闭环中感知、推理、行动、学习。它比传统工业控制多了一层"语义理解+物理常识+人机意图对齐",比纯AI多了一层"本体动力学与安全约束"。
一、总体闭环(文字架构图)
人 ──指令/示教/生理信号/意图──┐
↓
环境 ──视觉/力/触/声/物联/数字孪生─→ 多模态感知融合
↓
世界状态+任务语义建模
↓
大脑:任务理解/规划/推理(LLM/VLA/世界模型/神经符号)
↓
小脑:技能原语/轨迹/力控/MPCC/阻抗(分层或端到端)
↓
本体执行:双臂/人形/移动底盘/灵巧手/驱动
↓
反馈:本体感知+接触力+人行为+环境变化→再修正
↓
安全与人因层:风险评价/ISO安全链/虚拟围栏/急停/可解释/人因舒适(横切全栈)
核心不是"感知→动作"单环,而是人环反馈、物理反馈、任务反馈三路并行。
二、分层技术与人机环对应关系
1)感知层(懂环境、懂人、懂自身)
- 环境:RGB-D/激光/全景相机做3D重建;IMU、Encoder、力/力矩、触觉/电子皮肤做接触状态;PLC/RFID/MES/温湿度/AGV拓扑做产线上下文。
- 人:骨骼姿态、手势、眼动、语音、肌电/脑电(共融示教);用意图识别预测人下一步抓哪、走哪、用力多大。
- 自身:关节角、扭矩、末端口、能耗、振动、碰撞事件。
- 融合:跨模态对齐+时间戳同步,建"物体 affordance+空间占用+人占位+机器人可达域"的统一场景图。
2)认知与任务层(大脑)
- 自然语言/工单转任务:如"把变形线速布到A插接位"→子目标分解。
- 视觉-语言-动作 VLA:直接从图/语言生成技能参数;RT-2、OpenVLA、DOBOT-VLA、AWE 类属此路线。
- 世界模型:预测"执行某动作后物体/人/自身状态如何变",做内部预演,降低真机试错;V-JEPA、WAM、SPIRE 等都在往"理解+预测+行动"融合。
- 神经符号:神经网络做感知与候选,符号PDDL/规则做可验证规划,适合工业高可靠(拆螺栓、装配、异常回滚)。
- 人机共担:人定工艺/例外,机器人做重载/重复/高精度;或共享自治(shared autonomy),人遥控微操、机器人保底安全。
3)运动与交互层(小脑/控制)
- 单臂:IK、轨迹规划、PID/计算力矩、MPCC。
- 双臂/全身:全身控制 WBC、主从/协同、力-位混合、阻抗/导纳;持物时解"合力/合力矩分配",自碰撞用AABB/距离场实时避。
- 柔顺人机:关节力矩+六维力+触觉反馈做阻抗自适应;人靠近切换"功率力限制/速度分离/监控停止"。
- 移动操作:底盘+臂协同,SLAM+局部重规划,足式用平衡MPC、轮式用跟踪MPC。
- 学习控制:模仿学习做示教迁移,RL/模仿在仿真预训、真机微调;Sim-to-Real 解决光照/接触/摩擦偏差。
4)安全、人因与治理层(横切)
- 功能安全:ISO 10218 系列、ISO/TS 15066 协作四模式------功率力限制 PFL、速度分离监控、安全监控停止、手动导引;接触力/压强按人体部位限幅。
- 主动安全:视觉/雷达虚拟围栏、贝叶斯轨迹重规划、"虚拟气囊"在极小间距主动避;独立安全PLC/双通道急停,不与AI主规划混跑。
- 人因:人机站位、可观察性(机器人状态灯/语音/AR)、示教疲劳、肌电刚度迁移让人机力度匹配;共融不是"人不碰就行",而是力-运动双向适配。
- 网络安全/数据合规/伦理:模型误判兜底、操作权回收、审计日志。
三、人机环三类交互模式
- 人---机器人:指令、拖拽示教、肌/脑信号、共享自治、力反馈共搬;重点是人意图预测+机器人可预测性(别突然变轨)。
- 机器人---环境:物体识别/形变/柔体(线速、布料)、接触力学、温湿/洁净/防爆、产线节拍;重点是世界模型+力控,不只靠视觉定位。
- 人---环境---机器人闭环:人改工位、混料、插单,机器人重规划。例:ICT上下料中挪动料盘→重定位抓取,混料→识别跳单,产线人员低代码重训新任务。
四、制造场景典型栈(以双臂/人形柔性装配为例)
- MES/工单→大脑解析"车型/线束/扭矩/插接位"
- 3D相机+力觉建场景图:线速形变、插座位、人体位置
- VLA/世界模型拆"取线→理线→对位→插入→保压→自检"
- 双臂WBC分配:主手理形、副手对插;阻抗随接触状态调刚/柔
- 六维力+触觉判断是否到位/打滑;不达标回滚重对
- 人若介入补线,机器人降速/让位/学人力度(示教迁移)
- 数字孪生预演+真机数据回传,持续更新技能库与装配模型
汽车线束、小批电子装配、机器上下料、仓储拆垛是最先跑通的:它石A1做线束多机协同,浙江NAVIAI做轮臂集群拆垛-分拣-装配,东莞超级工站做ICT上下料自定位自跳单,极智嘉做仓储4D/世界模型抓取。
五、主要难点(写论文可直接用)
- 人机意图不确定性:人非固定轨迹,需在线估意图而非等明确指令。
- 柔体/接触建模:线速、布料、橡皮件形变+摩擦,VLA纯视觉不稳,必须力触融合。
- 双臂/全身耦合:持物动力学、自碰撞、基座反作用,WBC实时性要求高。
- 安全与自主矛盾:AI越自主越不能把摄像头当安全传感器;安全链须独立风险评价。
- Sim-to-Real缺口:接触、材质、人行为仿真不足,真机采集贵;可用神经符号+世界模型降标。
- 人因与接受度:示教门槛、误停影响节拍、责任边界(谁为失败装配负责)。
- 实时性:总延迟≈感知+推理+控制;语义慢用云/边缘,力控快用本地小脑,分级执行。
六、技术选型建议
- 高可靠工业:符号任务规划+MPC/阻抗执行+独立安全链,VLA只做辅助排故/换型。
- 柔性小批/换型频繁:VLA+世界模型预演+模仿学习示教,人工确认后下发。
- 人机共搬/双臂:肌电/姿态估人刚度→机器人阻抗匹配,数字孪生先跑再真机。
- 多机人机环:统一场景图+任务市场(task auction)+各本体小脑,避免中心大脑单点延迟。
