简
联系
菜单
研究日志

评估

选择 Samsara 的检查点

选定的80,000步的检查点比34,000步的候选人领先了两集完成了两集。所有五个结果均来自同一个2,000集的评估。

Samsara 选定的 80,000 步检查点完成了 1,897 个 LIBERO 回合。34,000 步检查点完成了 1,895 个。在相同的 2,000 次尝试中,两者仅相差两次成功。

我们根据相同的四十个任务和每项任务的五十个初始 状态对五个候选人进行了评估,然后选择了最高的分数。

训练最新情况成功的回合成功率
20,0001,862 / 2,00093.10%
34,0001,895 / 2,00094.75%
40,0001,878 / 2,00093.90%
60,0001,889 / 2,00094.45%
80,0001,897 / 2,00094.85%

训练后分数没有稳步提高。比34,000步候选人领先0.10个 百分点实在太小了,本次单种子竞选无法取得可靠的改善。 Samsara 报告 包括套件细分和训练设置。

按任务和初始状态逐一对照,能看到总分之外的差异。所选检查点在 34,000 步检查点失败的 68 个初始状态上成功;较早的检查点则在所选检查点失败的 66 个状态上成功。两次成功的领先背后,有 134 次结果发生变化。

选择改变了问题

这些回合有助于选择模型,因此94.85%的分数是 开发结果。确认将在使用保留示例之前修复检查点和评估 程序,然后在其他种子上重复此操作。

同样的问题也适用于 reflex-1 的诊断。其95.0%的Banking77和 92.2%的Emotion分数来自开发期间检查的500个示例子集,这些子集包含在训练中的任务系列。 这些结果描述了 熟悉的任务性能。新应用程序的问题需要他们自己的 评估。