JA
お問い合わせ
メニュー
研究ノート

発表

ロボット学習

Samsara-VLA を発表

記憶を備えたロボット制御を、2つのコンパクトなモデルで。

Good AI Labs 約 2 分で読めます

Samsara-VLA / 動作例
2つのモデル、4種類の操作。 公開した両チェックポイントから選んだ成功エピソードです。シーンカメラと手首カメラを並べて表示しています。 記録した動作を元のシミュレータで最初から最後まで再現しています。再生はシミュレーション時間に沿い、推論の待ち時間は含みません。成功率は全評価から算出しています。

Samsara-VLA は、観測から次の観測へ文脈を引き継ぐロボットポリシーです。2つのカメラ視点と指示を使い、つかむ、置く、開けるといった動作や連続した作業を行います。上の動画では、公開した2モデルの成功エピソードを最初から最後まで確認できます。

2つの規模、共通のポリシーインターフェース。

217M パラメータの Samsara-VLA は、ネイティブ LIBERO の 2,000 エピソード中 1,890 を完了しました。Samsara-VLA Tiny は 136M パラメータで、同じ評価プロトコルの下で 1,786 を完了しました。

フルモデル

Samsara-VLA

ネイティブ LIBERO 成功率
94.50%
パラメータ数
217.43M

1,890 / 2,000 成功エピソード

コンパクトモデル

Samsara-VLA Tiny

ネイティブ LIBERO 成功率
89.30%
パラメータ数
136.52M

1,786 / 2,000 成功エピソード

差が最も大きいのは長いタスクです。フルモデルの成功率は 89.8%、Tiny は 76.0% です。物体選択は両方とも高く、それぞれ 99.4% と 98.2%。Tiny はパラメータ数を 37.2% 削減しています。

動作間の文脈

各判断では、シーンの新しい観測と、過去の観測を保持したコンパクトな記憶を組み合わせます。ポリシーは12個の制御動作を予測して実行し、再び観測します。新しいタスクが始まると記憶をリセットします。

ローカルで実行できるポリシー

両モデルは CPU と CUDA 実行用の Python SDK を共有し、ブラウザ推論向けの ONNX エクスポートを備えています。ブラウザプレビューはモデル読み込み後、WebGPU または WebAssembly CPU を使って利用者のデバイス上で動作します。

これらは実験段階のシミュレーション用ポリシーです。ネイティブ実行の結果は、訓練済みの40タスクテンプレートを単一の評価シードで測定したものです。ブラウザのデモは別に実施しています。モデルとプレビューは研究利用の申請でアクセスできます。手法と制限は完全版モデルカードを、スイート別結果と公表モデルとの比較は研究ページをご覧ください。

モデル詳細

Samsara-VLA

再帰的な記憶を持つロボット制御。217M パラメータで、ネイティブ LIBERO 成功率 94.50%。