1. 先确认实验究竟测了什么
阅读时先看任务和训练、测试的划分。LIBERO 将空间关系、物体和目标等不同类型的知识迁移分别纳入任务套件。各套件回答的问题不同,只给分数而不说明套件,会丢失关键语境。[1]
我们的阅读建议是先把主张写成一句话:这个策略在接受这些训练后,在这些条件下完成了这些任务。随后明确,测试时究竟什么是它没有见过的。新视角、新物体实例与新技能,检验的是不同层面的泛化。
- 记录基准版本、任务子集和训练数据。
- 核对测试中的物体、场景或示范是否曾出现在训练阶段。
- 区分已知任务内部的变化与向未见任务的迁移。
2. 把成功率与实验设置一起读
RLBench 提供不同的观测与动作设置,并明确规定了用于基准比较的机械臂。因此,配置是结果的一部分,并非无关紧要的实现细节。[2]
制作对照表时,记录传感器、相机视角、控制器、动作频率和单次试验的时长或步数上限。直接获得物体坐标的策略,与只看图像的策略,得到的信息不同;借助规划器的动作接口,也会改变学习模型需要解决的问题。确认评测条件具有足够可比性后,再比较成绩。
- 查看成功判定标准、试验次数和不确定性的报告方式。
- 确认重试、复位或人工介入是否计为失败。
- 结合各任务结果理解平均值,关注反复出现的失败情形。
3. 区分数据多样性与已验证的迁移能力
DROID 的策略文档建议在训练混合数据中加入目标场景的示范。因此,阅读基于 DROID 的结果时,要核对被测场景是否提供了额外训练数据。[3]
我们的解读原则是分别看待仿真结果、真实机器人评测和部署主张。仿真可以检验一个明确的假设;真实世界表现则需要真实试验支持。单凭其中一种评测,都无法证明机器人在所有环境中的可靠性。进一步追问:哪些变化被单独测试过,哪些组合仍未测试?
- 列出已测试的变化:物体、光照、布局、相机或机器人。
- 确认是否进行目标场景适配,以及使用了哪些示范。
- 真实机器人试验需记录硬件和失败后的恢复流程。
- 将未经测试的环境保留为待解问题,不推定已有相应能力。
4. 让结论停留在证据支持的范围内
robomimic 研究报告了结果对示范质量、算法选择和训练停止标准的敏感性。这提示读者,理解一个醒目的分数,还需要知道模型如何训练、又如何被选中。[4]
引用论文前,记录版本、发表状态,以及可获得的代码或评测流程。arXiv 链接本身不能证明论文已经通过同行评审,应另行核对发表信息。演示视频可以呈现行为,却无法展示完整的试验结果分布。这里提供的是阅读建议,并非对所引研究的独立复现。
- 区分作者观察到的现象、对此的解释与未来目标。
- 标明自己的解读,并保留原实验的局限。
- 最后写下三点:测试了什么、观察到什么、仍不知道什么。