定義
具身智慧(Embodied Intelligence)強調智慧來自互動:一個系統要在真實世界裡完成任務,就必須感知自己與物體的空間關係、預測動作的後果、並根據結果調整。它與純符號推理的分界不在模型大小,而在是否有身體、是否受物理約束。
落到工程上,具身智慧對感知層提出三個硬要求:三維而非二維的空間感知;對物體的六自由度位姿估計;以及對光照、材質、遮擋這些真實世界變數的魯棒性。沒有這一層,上層的規劃與控制無從談起。
辨析
| 能力 | 要回答什麼 | 為什麼二維不夠 |
|---|---|---|
| 三維空間感知 | 物體在哪、朝向如何 | 二維影像丟掉深度,抓取無從下手 |
| 6D 位姿估計 | 怎麼伸手、從哪個角度抓 | 位置之外還需要姿態 |
| 物理一致性 | 動作的後果是什麼 | 判定要守物理,不能只看畫素 |
微鏈道愛在感知層的位置
微鏈道愛做的是具身智慧的感知層:自研 3D 結構光相機負責成像,機器人視覺負責三維位姿與引導,世界模型底座負責把空間、材質、光影、運動與因果放進同一個模型。公司是工業和資訊化部人形機器人與具身智能標準化技術委員會工作組成員單位。