VLA:从观测和指令生成动作
视觉—语言—动作模型简称 VLA,利用视觉观测和语言指令,在指定的机器人动作接口中输出动作。RT-2 是其中一种实现:它将机器人动作表示为词元,并结合机器人轨迹与视觉语言任务进行训练。推理时,输出词元被解码成动作,用于闭环控制。这是一种具体方案,并不意味着所有 VLA 都必须采用相同的动作表示。 [1]
OpenVLA 提供了另一个参考:面向机器人操作的开放模型与训练流程,可通过微调适配新的机器人配置。其公开演示区分了直接部署和针对特定机器人的微调。解读泛化能力时,需要保留这一区别。 [2]
世界模型:预测动作可能带来的变化
世界模型学习环境的表示,并预测未来的某些方面;具体预测什么,取决于系统设计。在 Dreamer 中,学习得到的模型预测候选动作对应的未来潜在表示与奖励,策略通过想象中的经验得到改进。因此,这里的模型服务于策略学习,并非仅用于生成看起来逼真的视频。 [3]
这一术语也用于其他研究场景。Google DeepMind 将 Genie 2 描述为能够根据动作生成交互式虚拟环境的模型。这些例子说明:比较被称为“世界模型”的系统之前,应先弄清各自的输入、输出和预期用途。 [4]
两种角色如何出现在同一流程中
假设一个系统接到“把杯子放到托盘上”的指令:VLA 可以根据相机图像和指令提出机器人动作;以动作为条件的世界模型可以估计候选动作的结果,再由其他组件进行比较。机器人随后执行受限的一段运动,观察实际结果,并更新下一步决策。这是用于解释分工的假想架构,并不表示所引用项目已经实现了这一具体组合。
更有用的问题是:组件之间传递什么信息,由哪个组件最终选择动作,以及实际观测与预测不一致时如何处理。使用相似的术语,并不能证明组件已经有效协同。
结合评估条件理解能力声明
实际评估时,建议先记录机器人、传感器、动作接口、任务和训练数据,再检查测试是否改变物体、光照、布局或物理条件,以及是否允许适配和人工干预。任务成功率与预测质量应分开考察:一段看起来合理的想象轨迹,不能证明真实机器人能够将它执行出来。
本指南建议把 VLA 和世界模型视为角色描述,而非通用的能力等级。不同论文的定义和架构可能不同。判断能否部署之前,应查看可重复的任务证据、失败案例和运行范围。单凭任何一个名称,都不能认定系统具备通用智能,或在新环境中运行可靠。