评估
选择 Samsara 的检查点
选定的80,000步的检查点比34,000步的候选人领先了两集完成了两集。所有五个结果均来自同一个2,000集的评估。
Samsara 选定的 80,000 步检查点完成了 1,897 个 LIBERO 回合。34,000 步检查点完成了 1,895 个。在相同的 2,000 次尝试中,两者仅相差两次成功。
我们根据相同的四十个任务和每项任务的五十个初始 状态对五个候选人进行了评估,然后选择了最高的分数。
| 训练最新情况 | 成功的回合 | 成功率 |
|---|---|---|
| 20,000 | 1,862 / 2,000 | 93.10% |
| 34,000 | 1,895 / 2,000 | 94.75% |
| 40,000 | 1,878 / 2,000 | 93.90% |
| 60,000 | 1,889 / 2,000 | 94.45% |
| 80,000 | 1,897 / 2,000 | 94.85% |
训练后分数没有稳步提高。比34,000步候选人领先0.10个 百分点实在太小了,本次单种子竞选无法取得可靠的改善。 Samsara 报告 包括套件细分和训练设置。
按任务和初始状态逐一对照,能看到总分之外的差异。所选检查点在 34,000 步检查点失败的 68 个初始状态上成功;较早的检查点则在所选检查点失败的 66 个状态上成功。两次成功的领先背后,有 134 次结果发生变化。
选择改变了问题
这些回合有助于选择模型,因此94.85%的分数是 开发结果。确认将在使用保留示例之前修复检查点和评估 程序,然后在其他种子上重复此操作。
同样的问题也适用于 reflex-1 的诊断。其95.0%的Banking77和 92.2%的Emotion分数来自开发期间检查的500个示例子集,这些子集包含在训练中的任务系列。 这些结果描述了 熟悉的任务性能。新应用程序的问题需要他们自己的 评估。