繁
聯絡
選單
研究日誌

評估

選擇 Samsara 的檢查點

選定的80,000步的檢查點比34,000步的候選人領先了兩集完成了兩集。所有五個結果均來自同一個2,000集的評估。

Samsara 選定的 80,000 步檢查點完成了 1,897 個 LIBERO 回合。34,000 步檢查點完成了 1,895 個。在相同的 2,000 次嘗試中,兩者僅相差兩次成功。

我們根據相同的四十個任務和每項任務的五十個初始 狀態對五個候選人進行了評估,然後選擇了最高的分數。

訓練最新情況成功的回合成功率
20,0001,862 / 2,00093.10%
34,0001,895 / 2,00094.75%
40,0001,878 / 2,00093.90%
60,0001,889 / 2,00094.45%
80,0001,897 / 2,00094.85%

訓練後分數沒有穩步提高。比34,000步候選人領先0.10個 百分點實在太小了,本次單種子競選無法取得可靠的改善。 Samsara 報告 包括套件細分和訓練設定。

按任務和初始狀態逐一對照,能看到總分之外的差異。所選檢查點在 34,000 步檢查點失敗的 68 個初始狀態上成功;較早的檢查點則在所選檢查點失敗的 66 個狀態上成功。兩次成功的領先背後,有 134 次結果發生變化。

選擇改變了問題

這些回合有助於選擇模型,因此94.85%的分數是 開發結果。確認將在使用保留示例之前修複檢查點和評估 程式,然後在其他種子上重複此操作。

同樣的問題也適用於 reflex-1 的診斷。其95.0%的Banking77和 92.2%的Emotion分數來自開發期間檢查的500個示例子集,這些子集包含在訓練中的任務系列。 這些結果描述了 熟悉的任務效能。新應用程式的問題需要他們自己的 評估。