简
联系
菜单
研究日志

机器人学习

机器人放置的四项测试

位置可以达到目标并在之后倒下。四种历史上的 Samsara 协议测试了何时成功才是最重要的。

机器人可以在球门处放置物体,然后在下一步 移动时将其击落。如果评估人员在第一次成功时停下来,则稳定的安置 和短暂的接触都算作通过。

我们之前的 Samsara 实验使用了四条停止规则。环境报告目标状态后,第一个 计算成功率。 第二种要求在政策继续发挥作用的同时坚持下去。 然后第三个停止了控制,等了二十步。第四款在部署期间增加了执行器 干扰,同时保留了持续和 不干涉的要求。

第一次接触CHECKPOINT V9 · 400 集
96.50 百分之
持续控制CHECKPOINT V10 · 400 集
93.75 百分之
再加上 20 个步骤CHECKPOINT V12 · 400 集
92.25 百分之
有执行器干扰CHECKPOINT V12 · 400 集
90.25 百分之
历史发展成果。每个协议都涵盖了400个回组合,但检查点也发生了变化。

每项结果包含每个套件 100 个回合,共 400 个,使用随机种子 1701 和初始状态 10–19。首次成功标准下的 96.50% 使用 v9;持续控制下的 93.75% 使用 v10。停止干预和施加扰动的结果为 92.25% 和 90.25%,使用 v12。检查点发生了变化,因此不能把得分差异完全归因于评分规则。

当前的基准测试使用不同的规则

当前的Samsara评估 使用了217M参数的架构和2,000个回组合。它的固定评估 部署在首次成功终止环境时停止。 94.85% 的总分和 99.6% 的对象分数使用了该规则。

对之前的四条规则进行控制比较将使策略保持不 变,并重播相同的条件。在此之前,历史结果 和当前的基准测试回答了有关操纵的不同问题。