評価
Samsaraのチェックポイントの選択
選ばれた80,000歩のチェックポイントは、34,000歩の候補より2エピソード早く終了しました。5つすべては、同じ2,000エピソード評価の結果です。
Samsara で選択した 80,000 ステップのチェックポイントは、LIBERO の 1,897 エピソードで成功しました。34,000 ステップのチェックポイントは 1,895 エピソードで成功しました。同じ 2,000 試行での差は、成功二回です。
同じ40個のタスクとタスクあたり50個の初期状態について5人の候補を評価し、最高得点を選択しました。
| トレーニングアップデート | 成功したエピソード | 成功率 |
|---|---|---|
| 20,000 | 1,862 / 2,000 | 93.10% |
| 34,000 | 1,895 / 2,000 | 94.75% |
| 40,000 | 1,878 / 2,000 | 93.90% |
| 60,000 | 1,889 / 2,000 | 94.45% |
| 80,000 | 1,897 / 2,000 | 94.85% |
トレーニングを行ってもスコアは着実に向上しませんでした。 34,000ステップの候補を0.10ポイント上回るリードは、このシングルシードランでは信頼性のある改善を示すには小さすぎます。 Samsara レポートには、スイートの内訳とトレーニング設定が含まれています。
タスクと初期状態を対応させると、合計だけでは見えない違いが分かります。選択したチェックポイントは、34,000 ステップのモデルが失敗した 68 の初期状態で成功しました。一方、以前のモデルは選択モデルが失敗した 66 の状態で成功しました。成功数の差は二つですが、結果が変わった試行は 134 あります。
選択によって質問が変わる
これらのエピソードが機種選びの参考になったので、94.85% というスコアは開発成果です。 確認を行うと、 予約済みのサンプルを使用する前にチェックポイントと評価手順が修正され、他のシードでも同じ手順が繰り返されます。
同じ問題がreflex-1の診断にも当てはまります。 Banking77のスコアは95.0%、Emotion スコアは92.2%で、 開発中にトレーニングに含まれるタスクファミリーについて検査された500例のサブセットから得られました。これらの結果は、 使い慣れたタスクのパフォーマンスを表しています。 新しいアプリケーションの質問には独自の評価が必要です。