[↖ 研究日誌](https://www.goodailabs.com/zh-tw/blog/) 評估 # 選擇 Samsara 的檢查點 選定的80,000步的檢查點比34,000步的候選人領先了兩集完成了兩集。所有五個結果均來自同一個2,000集的評估。 Good AI Labs 2026年10月3日 2 分鐘閱讀 在這篇文章中 - [選擇改變了問題](https://www.goodailabs.com/#selection-changes-the-question) [全部文章 ↗](https://www.goodailabs.com/zh-tw/blog/) Samsara 選定的 80,000 步檢查點完成了 1,897 個 LIBERO 回合。34,000 步檢查點完成了 1,895 個。在相同的 2,000 次嘗試中,兩者僅相差兩次成功。 我們根據相同的四十個任務和每項任務的五十個初始 狀態對五個候選人進行了評估,然後選擇了最高的分數。 訓練最新情況 | 成功的回合 | 成功率 | 20,000 | 1,862 / 2,000 | 93.10% | 34,000 | 1,895 / 2,000 | 94.75% | 40,000 | 1,878 / 2,000 | 93.90% | 60,000 | 1,889 / 2,000 | 94.45% | 80,000 | 1,897 / 2,000 | 94.85% | 訓練後分數沒有穩步提高。比34,000步候選人領先0.10個 百分點實在太小了,本次單種子競選無法取得可靠的改善。 [Samsara 報告](https://www.goodailabs.com/zh-tw/research/samsara-vla/) 包括套件細分和訓練設定。 按任務和初始狀態逐一對照,能看到總分之外的差異。所選檢查點在 34,000 步檢查點失敗的 68 個初始狀態上成功;較早的檢查點則在所選檢查點失敗的 66 個狀態上成功。兩次成功的領先背後,有 134 次結果發生變化。 ## 選擇改變了問題 這些回合有助於選擇模型,因此94.85%的分數是 開發結果。確認將在使用保留示例之前修複檢查點和評估 程式,然後在其他種子上重複此操作。 同樣的問題也適用於 reflex-1 的診斷。其95.0%的Banking77和 92.2%的Emotion分數來自開發期間檢查的500個示例子集,這些子集包含在訓練中的任務系列。 這些結果描述了 熟悉的任務效能。新應用程式的問題需要他們自己的 評估。 ∎[回到日記 ↗](https://www.goodailabs.com/zh-tw/blog/) 繼續閱讀 [代理系統Colony 簡介:擁有記憶和工具的個人智慧體↗](https://www.goodailabs.com/zh-tw/blog/colony-runtime-and-model-budget/) [空間記憶re1 簡介:物理 AI 的空間記憶↗](https://www.goodailabs.com/zh-tw/blog/re1-video-memory/)