[↖ 研究日志](https://www.goodailabs.com/zh-cn/blog/) 评估 # 选择 Samsara 的检查点 选定的80,000步的检查点比34,000步的候选人领先了两集完成了两集。所有五个结果均来自同一个2,000集的评估。 Good AI Labs 2026年10月3日 2 分钟阅读 在这篇文章中 - [选择改变了问题](https://www.goodailabs.com/#selection-changes-the-question) [全部文章 ↗](https://www.goodailabs.com/zh-cn/blog/) Samsara 选定的 80,000 步检查点完成了 1,897 个 LIBERO 回合。34,000 步检查点完成了 1,895 个。在相同的 2,000 次尝试中,两者仅相差两次成功。 我们根据相同的四十个任务和每项任务的五十个初始 状态对五个候选人进行了评估,然后选择了最高的分数。 训练最新情况 | 成功的回合 | 成功率 | 20,000 | 1,862 / 2,000 | 93.10% | 34,000 | 1,895 / 2,000 | 94.75% | 40,000 | 1,878 / 2,000 | 93.90% | 60,000 | 1,889 / 2,000 | 94.45% | 80,000 | 1,897 / 2,000 | 94.85% | 训练后分数没有稳步提高。比34,000步候选人领先0.10个 百分点实在太小了,本次单种子竞选无法取得可靠的改善。 [Samsara 报告](https://www.goodailabs.com/zh-cn/research/samsara-vla/) 包括套件细分和训练设置。 按任务和初始状态逐一对照,能看到总分之外的差异。所选检查点在 34,000 步检查点失败的 68 个初始状态上成功;较早的检查点则在所选检查点失败的 66 个状态上成功。两次成功的领先背后,有 134 次结果发生变化。 ## 选择改变了问题 这些回合有助于选择模型,因此94.85%的分数是 开发结果。确认将在使用保留示例之前修复检查点和评估 程序,然后在其他种子上重复此操作。 同样的问题也适用于 reflex-1 的诊断。其95.0%的Banking77和 92.2%的Emotion分数来自开发期间检查的500个示例子集,这些子集包含在训练中的任务系列。 这些结果描述了 熟悉的任务性能。新应用程序的问题需要他们自己的 评估。 ∎[回到日记 ↗](https://www.goodailabs.com/zh-cn/blog/) 继续阅读 [代理系统Colony 简介:拥有记忆和工具的个人智能体↗](https://www.goodailabs.com/zh-cn/blog/colony-runtime-and-model-budget/) [空间记忆re1 简介:物理 AI 的空间记忆↗](https://www.goodailabs.com/zh-cn/blog/re1-video-memory/)