[↖ 研究日志](https://www.goodailabs.com/zh-cn/blog/) 机器人学习 # 机器人放置的四项测试 位置可以达到目标并在之后倒下。四种历史上的 Samsara 协议测试了何时成功才是最重要的。 Good AI Labs 2026年10月2日 2 分钟阅读 在这篇文章中 - [当前的基准测试使用不同的规则](https://www.goodailabs.com/#the-current-benchmark-uses-a-different-rule) [全部文章 ↗](https://www.goodailabs.com/zh-cn/blog/) 机器人可以在球门处放置物体,然后在下一步 移动时将其击落。如果评估人员在第一次成功时停下来,则稳定的安置 和短暂的接触都算作通过。 我们之前的 Samsara 实验使用了四条停止规则。环境报告目标状态后,第一个 计算成功率。 第二种要求在政策继续发挥作用的同时坚持下去。 然后第三个停止了控制,等了二十步。第四款在部署期间增加了执行器 干扰,同时保留了持续和 不干涉的要求。 第一次接触CHECKPOINT V9 · 400 集 96.50 百分之 持续控制CHECKPOINT V10 · 400 集 93.75 百分之 再加上 20 个步骤CHECKPOINT V12 · 400 集 92.25 百分之 有执行器干扰CHECKPOINT V12 · 400 集 90.25 百分之 0%成功率/ 100% 历史发展成果。每个协议都涵盖了400个回组合,但检查点也发生了变化。 每项结果包含每个套件 100 个回合,共 400 个,使用随机种子 1701 和初始状态 10–19。首次成功标准下的 96.50% 使用 v9;持续控制下的 93.75% 使用 v10。停止干预和施加扰动的结果为 92.25% 和 90.25%,使用 v12。检查点发生了变化,因此不能把得分差异完全归因于评分规则。 ## 当前的基准测试使用不同的规则 [当前的Samsara评估](https://www.goodailabs.com/zh-cn/research/samsara-vla/) 使用了217M参数的架构和2,000个回组合。它的固定评估 部署在首次成功终止环境时停止。 94.85% 的总分和 99.6% 的对象分数使用了该规则。 对之前的四条规则进行控制比较将使策略保持不 变,并重播相同的条件。在此之前,历史结果 和当前的基准测试回答了有关操纵的不同问题。 ∎[回到日记 ↗](https://www.goodailabs.com/zh-cn/blog/) 继续阅读 [实验室我们为什么要建立本地模型↗](https://www.goodailabs.com/zh-cn/blog/goodness-first/) [系统为本地型号选择硬件↗](https://www.goodailabs.com/zh-cn/blog/sovereign-intelligence/)