一个便于理解的定义
具身智能关注智能体、身体与周围环境之间的关系。可以把它理解为:智能体根据观察选择动作,经历动作产生的后果,再围绕目标调整行为的能力。不同研究对这个概念的用法有所不同;它并不特指某一种模型架构,也没有一个测试就能完整衡量它。
身体本身也是研究问题的一部分。摄像头的位置影响能看到什么,夹爪的形状限制能抓住什么。Gupta 等人关于学习与演化的研究,探索了仿真中的身体设计如何让控制更容易被学会。这些发现适用于论文研究的环境与智能体,不能直接视为通用的机器人设计方案。 [2]
用移动杯子理解感知与行动的循环
设想一个用于说明概念的任务:把桌上的杯子移到托盘里。机器人先通过传感器估计杯子的位置,选择能够到达的抓取方式,再移动机械臂。动作会改变场景。后续观察可能表明杯子移动了、没有抓稳,或正在滑落;下一步动作应根据这些新情况调整。
这个循环把感知、决策、行动和反馈联系起来。完成任务需要在约束条件下取得实际结果,仅仅描述一套看似合理的步骤还不够。时序、接触和可用传感器都会影响结果。Roy 等人的文章讨论了物理交互中的学习为何面临超出常规机器学习设置的挑战,包括适应变化以及错误带来的实际后果。杯子的例子用于解释原理,并非某个系统的性能报告。 [1]
机器人、语言模型与仿真分别处于什么位置
机器人是一种物理机器,这个名称本身并不能证明它具有灵活学习或通用智能的能力。纯文本助手可以解释如何拿起杯子,而不感知或控制那个杯子。不过,语言模型可以成为具身系统的一个组成部分。例如,RT-2 研究如何结合网络数据与机器人数据,把视觉和语言表征连接到机器人动作。 [3]
具身人工智能研究也包括仿真中的智能体。Habitat 为导航等任务提供了用于训练和评估的虚拟环境。仿真便于进行可重复的实验,但仿真中的结果本身不能证明真实硬件上的表现。研究者还需要检验哪些观察、动作和环境假设能够迁移到现实中。 [4]
阅读研究结论时核对什么
应把演示看作特定测试条件下的证据。阅读时可以依次核对:
- 系统使用了什么身体、传感器和动作,完成什么任务?
- 结果来自仿真,还是真实机器人?
- 训练与评估之间改变了什么,又保留了哪些熟悉的条件?
- 报告了多少次试验,是否说明失败情况或人工干预?
把论文报告的结果与你自己的解读区分开。一种有潜力的方法,仍可能只适用于较窄的运行条件。流畅的解释或一次成功演示,都不足以单独证明广泛的物理任务能力。实验细节和适用边界仍应回到原论文核查。