指示からタスク完了まで
上段は Samsara-VLA、下段は Samsara-VLA Tiny。全カテゴリを並べて表示しています。
空間
位置の説明に合う物体を見つける。
Samsara-VLA
“皿とラメキンの間にある黒いボウルを持ち上げて皿に置く”
Samsara-VLA Tiny
“皿とラメキンの間にある黒いボウルを持ち上げて皿に置く”
物体
複数の物体から指定されたものを選ぶ。
Samsara-VLA
“クリームチーズを持ち上げてかごに入れる”
Samsara-VLA Tiny
“クリームチーズを持ち上げてかごに入れる”
目標
指示に合うように環境の状態を変える。
Samsara-VLA
“キャビネットの中央の引き出しを開ける”
Samsara-VLA Tiny
“キャビネットの中央の引き出しを開ける”
長期タスク
複数の動作を要する指示を実行する。
Samsara-VLA
“アルファベットスープの缶とクリームチーズの箱を両方かごに入れる”
Samsara-VLA Tiny
“アルファベットスープの缶とクリームチーズの箱を両方かごに入れる”
Samsara-VLA は、観測から次の観測へ文脈を引き継ぐロボットポリシーです。2つのカメラ視点と指示を使い、つかむ、置く、開けるといった動作や連続した作業を行います。上の動画では、公開した2モデルの成功エピソードを最初から最後まで確認できます。
2つの規模、共通のポリシーインターフェース。
217M パラメータの Samsara-VLA は、ネイティブ LIBERO の 2,000 エピソード中 1,890 を完了しました。Samsara-VLA Tiny は 136M パラメータで、同じ評価プロトコルの下で 1,786 を完了しました。
フルモデル
Samsara-VLA
- ネイティブ LIBERO 成功率
- 94.50%
- パラメータ数
- 217.43M
1,890 / 2,000 成功エピソード
コンパクトモデル
Samsara-VLA Tiny
- ネイティブ LIBERO 成功率
- 89.30%
- パラメータ数
- 136.52M
1,786 / 2,000 成功エピソード
差が最も大きいのは長いタスクです。フルモデルの成功率は 89.8%、Tiny は 76.0% です。物体選択は両方とも高く、それぞれ 99.4% と 98.2%。Tiny はパラメータ数を 37.2% 削減しています。
動作間の文脈
各判断では、シーンの新しい観測と、過去の観測を保持したコンパクトな記憶を組み合わせます。ポリシーは12個の制御動作を予測して実行し、再び観測します。新しいタスクが始まると記憶をリセットします。
ローカルで実行できるポリシー
両モデルは CPU と CUDA 実行用の Python SDK を共有し、ブラウザ推論向けの ONNX エクスポートを備えています。ブラウザプレビューはモデル読み込み後、WebGPU または WebAssembly CPU を使って利用者のデバイス上で動作します。
これらは実験段階のシミュレーション用ポリシーです。ネイティブ実行の結果は、訓練済みの40タスクテンプレートを単一の評価シードで測定したものです。ブラウザのデモは別に実施しています。モデルとプレビューは研究利用の申請でアクセスできます。手法と制限は完全版モデルカードを、スイート別結果と公表モデルとの比較は研究ページをご覧ください。
モデル詳細
Samsara-VLA
再帰的な記憶を持つロボット制御。217M パラメータで、ネイティブ LIBERO 成功率 94.50%。