ロボット学習
ロボットの配置に関する4つのテスト
プレースメントがゴールに到達しても、その後転倒することがあります。成功が重要視される時代に、4つの歴史的なSamsara プロトコルがテストされました。
ロボットはゴールに物を置き、 次の動きでそれをノックオフすることができます。評価者が最初の成功で停止した場合、 安定したプレースメントと短い連絡の両方が合格とみなされます。
以前のSamsara 実験では、4つの停止ルールを使用していました。最初は、 環境が目標状態を報告するとすぐに成功を数えました。 2つ目は、ポリシーが機能し続ける間もそれを維持することを要求しました。 その後、3人目は制御を停止し、20歩待ちました。4つ目は、持続性とハンズオフの要件を維持しながら、 ロールアウト中にアクチュエータの妨害を追加しました。
各結果は、スイートごとに 100 エピソード、計 400 エピソードを対象とし、乱数シード 1701 と初期状態 10–19 を使用しました。最初の成功で判定する 96.50% の結果は v9、継続制御での 93.75% は v10 です。操作停止後と外乱下での 92.25%、90.25% は v12 を使用しました。チェックポイントが異なるため、スコア差を判定基準だけに帰することはできません。
現在のベンチマークは異なるルールを使用しています
現在のSamsara 評価では、217Mパラメーターのアーキテクチャと2,000のエピソードを使用しています。 ピン留めされた評価ロールアウトは、環境が最初に正常に終了した時点で停止します。全体スコアが 94.85%、オブジェクトスコアが 99.6% の場合は、このルールが採用されています。
以前の4つのルールを対照的に比較すると、 ポリシーが固定され、同じ条件が再現されます。それまでは、 過去の結果と現在のベンチマークが、操作に関するさまざまな質問に答えてくれます。