定义
具身智能(Embodied Intelligence)强调智能来自交互:一个系统要在真实世界里完成任务,就必须感知自己与物体的空间关系、预测动作的后果、并根据结果调整。它与纯符号推理的分界不在模型大小,而在是否有身体、是否受物理约束。
落到工程上,具身智能对感知层提出三个硬要求:三维而非二维的空间感知;对物体的六自由度位姿估计;以及对光照、材质、遮挡这些真实世界变量的鲁棒性。没有这一层,上层的规划与控制无从谈起。
辨析
| 能力 | 要回答什么 | 为什么二维不够 |
|---|---|---|
| 三维空间感知 | 物体在哪、朝向如何 | 二维图像丢掉深度,抓取无从下手 |
| 6D 位姿估计 | 怎么伸手、从哪个角度抓 | 位置之外还需要姿态 |
| 物理一致性 | 动作的后果是什么 | 判定要守物理,不能只看像素 |
微链道爱在感知层的位置
微链道爱做的是具身智能的感知层:自研 3D 结构光相机负责成像,机器人视觉负责三维位姿与引导,世界模型底座负责把空间、材质、光影、运动与因果放进同一个模型。公司是工业和信息化部人形机器人与具身智能标准化技术委员会工作组成员单位。