作者提出为视觉语言模型提供可进行机器人动作推演的视觉工作空间,在生成约束、编写程序或仅提供场景视图的现有方式上作出拓展。
提出的方法是世界行动代理(WAA),一个多代理系统,利用VLMs通过基本工具控制机器人。它具有接触视图、动作排练和在视图中校正等机制,根据观察和反馈优化动作。
作者报告,该系统可从专家视频和人类教学中获取具身程序性知识,并将技能从LIBERO迁移至robosuite。摘要提供了成功率及基线比较,但本简讯未对这些结果进行独立验证。
科研简讯 / 预印本
世界行动代理(WAA)通过视觉语言模型(VLMs)在视觉动作工作空间内控制机器人,以支持决策和技能获取。
来源复核后更新:修正了对视觉工作空间的表述,以及对摘要中性能数据和比较结果的说明。
作者提出为视觉语言模型提供可进行机器人动作推演的视觉工作空间,在生成约束、编写程序或仅提供场景视图的现有方式上作出拓展。
提出的方法是世界行动代理(WAA),一个多代理系统,利用VLMs通过基本工具控制机器人。它具有接触视图、动作排练和在视图中校正等机制,根据观察和反馈优化动作。
作者报告,该系统可从专家视频和人类教学中获取具身程序性知识,并将技能从LIBERO迁移至robosuite。摘要提供了成功率及基线比较,但本简讯未对这些结果进行独立验证。
本文依据公开预印本摘要整理,未对研究结果进行独立复现。实验方法、评估范围与限制请以原文为准。自动整理可能存在误差,阅读时请核对原始资料。