← 全部专题指南

IAEI / RESEARCH GUIDE

VLA 与世界模型:各自解决什么问题?

视觉—语言—动作模型将观测和指令连接到动作;世界模型预测环境的某些特征及其变化。理解两者承担的不同角色,有助于判断它们如何协同,以及应该用什么证据评估能力。

VLA:从观测和指令生成动作

视觉—语言—动作模型简称 VLA,利用视觉观测和语言指令,在指定的机器人动作接口中输出动作。RT-2 是其中一种实现:它将机器人动作表示为词元,并结合机器人轨迹与视觉语言任务进行训练。推理时,输出词元被解码成动作,用于闭环控制。这是一种具体方案,并不意味着所有 VLA 都必须采用相同的动作表示。 [1]

OpenVLA 提供了另一个参考:面向机器人操作的开放模型与训练流程,可通过微调适配新的机器人配置。其公开演示区分了直接部署和针对特定机器人的微调。解读泛化能力时,需要保留这一区别。 [2]

世界模型:预测动作可能带来的变化

世界模型学习环境的表示,并预测未来的某些方面;具体预测什么,取决于系统设计。在 Dreamer 中,学习得到的模型预测候选动作对应的未来潜在表示与奖励,策略通过想象中的经验得到改进。因此,这里的模型服务于策略学习,并非仅用于生成看起来逼真的视频。 [3]

这一术语也用于其他研究场景。Google DeepMind 将 Genie 2 描述为能够根据动作生成交互式虚拟环境的模型。这些例子说明:比较被称为“世界模型”的系统之前,应先弄清各自的输入、输出和预期用途。 [4]

两种角色如何出现在同一流程中

假设一个系统接到“把杯子放到托盘上”的指令:VLA 可以根据相机图像和指令提出机器人动作;以动作为条件的世界模型可以估计候选动作的结果,再由其他组件进行比较。机器人随后执行受限的一段运动,观察实际结果,并更新下一步决策。这是用于解释分工的假想架构,并不表示所引用项目已经实现了这一具体组合。

更有用的问题是:组件之间传递什么信息,由哪个组件最终选择动作,以及实际观测与预测不一致时如何处理。使用相似的术语,并不能证明组件已经有效协同。

结合评估条件理解能力声明

实际评估时,建议先记录机器人、传感器、动作接口、任务和训练数据,再检查测试是否改变物体、光照、布局或物理条件,以及是否允许适配和人工干预。任务成功率与预测质量应分开考察:一段看起来合理的想象轨迹,不能证明真实机器人能够将它执行出来。

本指南建议把 VLA 和世界模型视为角色描述,而非通用的能力等级。不同论文的定义和架构可能不同。判断能否部署之前,应查看可重复的任务证据、失败案例和运行范围。单凭任何一个名称,都不能认定系统具备通用智能,或在新环境中运行可靠。

本指南用于解释研究概念;示例与阅读建议属于编辑整理,所引研究结论应结合原论文的适用范围理解。 来源与更正规范

继续阅读