JA
お問い合わせ
メニュー
研究ノート

ロボット学習

ロボットの配置に関する4つのテスト

プレースメントがゴールに到達しても、その後転倒することがあります。成功が重要視される時代に、4つの歴史的なSamsara プロトコルがテストされました。

ロボットはゴールに物を置き、 次の動きでそれをノックオフすることができます。評価者が最初の成功で停止した場合、 安定したプレースメントと短い連絡の両方が合格とみなされます。

以前のSamsara 実験では、4つの停止ルールを使用していました。最初は、 環境が目標状態を報告するとすぐに成功を数えました。 2つ目は、ポリシーが機能し続ける間もそれを維持することを要求しました。 その後、3人目は制御を停止し、20歩待ちました。4つ目は、持続性とハンズオフの要件を維持しながら、 ロールアウト中にアクチュエータの妨害を追加しました。

ファーストコンタクトチェックポイントV9・400エピソード
96.50 パーセント
持続的管理チェックポイントV10 · 400 エピソード
93.75 パーセント
プラス20ステップハンズオフチェックポイントV12 · 400 エピソード
92.25 パーセント
アクチュエータ障害ありチェックポイントV12 · 400 エピソード
90.25 パーセント
歴史的開発結果。各プロトコルは400のエピソードをカバーしていましたが、チェックポイントも変わりました。

各結果は、スイートごとに 100 エピソード、計 400 エピソードを対象とし、乱数シード 1701 と初期状態 10–19 を使用しました。最初の成功で判定する 96.50% の結果は v9、継続制御での 93.75% は v10 です。操作停止後と外乱下での 92.25%、90.25% は v12 を使用しました。チェックポイントが異なるため、スコア差を判定基準だけに帰することはできません。

現在のベンチマークは異なるルールを使用しています

現在のSamsara 評価では、217Mパラメーターのアーキテクチャと2,000のエピソードを使用しています。 ピン留めされた評価ロールアウトは、環境が最初に正常に終了した時点で停止します。全体スコアが 94.85%、オブジェクトスコアが 99.6% の場合は、このルールが採用されています。

以前の4つのルールを対照的に比較すると、 ポリシーが固定され、同じ条件が再現されます。それまでは、 過去の結果と現在のベンチマークが、操作に関するさまざまな質問に答えてくれます。