作者提出为视觉语言模型提供可进行机器人动作推演的视觉工作空间,在生成约束、编写程序或仅提供场景视图的现有方式上作出拓展。

提出的方法是世界行动代理(WAA),一个多代理系统,利用VLMs通过基本工具控制机器人。它具有接触视图、动作排练和在视图中校正等机制,根据观察和反馈优化动作。

作者报告,该系统可从专家视频和人类教学中获取具身程序性知识,并将技能从LIBERO迁移至robosuite。摘要提供了成功率及基线比较,但本简讯未对这些结果进行独立验证。