評估
選擇 Samsara 的檢查點
選定的80,000步的檢查點比34,000步的候選人領先了兩集完成了兩集。所有五個結果均來自同一個2,000集的評估。
Samsara 選定的 80,000 步檢查點完成了 1,897 個 LIBERO 回合。34,000 步檢查點完成了 1,895 個。在相同的 2,000 次嘗試中,兩者僅相差兩次成功。
我們根據相同的四十個任務和每項任務的五十個初始 狀態對五個候選人進行了評估,然後選擇了最高的分數。
| 訓練最新情況 | 成功的回合 | 成功率 |
|---|---|---|
| 20,000 | 1,862 / 2,000 | 93.10% |
| 34,000 | 1,895 / 2,000 | 94.75% |
| 40,000 | 1,878 / 2,000 | 93.90% |
| 60,000 | 1,889 / 2,000 | 94.45% |
| 80,000 | 1,897 / 2,000 | 94.85% |
訓練後分數沒有穩步提高。比34,000步候選人領先0.10個 百分點實在太小了,本次單種子競選無法取得可靠的改善。 Samsara 報告 包括套件細分和訓練設定。
按任務和初始狀態逐一對照,能看到總分之外的差異。所選檢查點在 34,000 步檢查點失敗的 68 個初始狀態上成功;較早的檢查點則在所選檢查點失敗的 66 個狀態上成功。兩次成功的領先背後,有 134 次結果發生變化。
選擇改變了問題
這些回合有助於選擇模型,因此94.85%的分數是 開發結果。確認將在使用保留示例之前修複檢查點和評估 程式,然後在其他種子上重複此操作。
同樣的問題也適用於 reflex-1 的診斷。其95.0%的Banking77和 92.2%的Emotion分數來自開發期間檢查的500個示例子集,這些子集包含在訓練中的任務系列。 這些結果描述了 熟悉的任務效能。新應用程式的問題需要他們自己的 評估。