JA
お問い合わせ
メニュー

研究 実験段階

Samsara-VLA

記憶を持つロボット制御。

言語で指示する操作向けの、2つのコンパクトなロボットポリシー。つかむ、置く、開ける、複数手順のタスクを完了する様子をご覧ください。

Samsara-VLA / 動作例
2つのモデル、4種類の操作。 公開した両チェックポイントから選んだ成功エピソードです。シーンカメラと手首カメラを並べて表示しています。 記録した動作を元のシミュレータで最初から最後まで再現しています。再生はシミュレーション時間に沿い、推論の待ち時間は含みません。成功率は全評価から算出しています。

2つのモデル、共通インターフェース

Samsara-VLA は、カメラ画像、英語の指示、ロボットの状態を連続制御に変換します。観測間でコンパクトな記憶を保持し、一度に12個の動作を予測します。Samsara-VLA Tiny は同じインターフェースを使い、視覚エンコーダを小型化しています。

フルモデル

Samsara-VLA

ネイティブ LIBERO 成功率
94.50%
パラメータ数
217.43M

1,890 / 2,000 成功エピソード

コンパクトモデル

Samsara-VLA Tiny

ネイティブ LIBERO 成功率
89.30%
パラメータ数
136.52M

1,786 / 2,000 成功エピソード

Tiny はパラメータ数が 37.2% 少なく、総合成功率は5.2 ポイント差です。両方の数値には凍結したテキストエンコーダを含みます。どちらも 40,000 更新、教師ありサンプルの提示回数は延べ 5.12 百万回です。

ネイティブ LIBERO の評価結果

公開した各チェックポイントを40 タスク、2,000 エピソードで評価しました。各タスクには公式の初期状態を50通り使用しています。両モデルとも物体選択が最も高く、長い動作列で最も大きな差が見られます。

Samsara-VLASamsara-VLA Tiny

空間

Samsara-VLA 94.2%471 / 500
Samsara-VLA Tiny 89.8%449 / 500

物体

Samsara-VLA 99.4%497 / 500
Samsara-VLA Tiny 98.2%491 / 500

目標

Samsara-VLA 94.6%473 / 500
Samsara-VLA Tiny 93.2%466 / 500

長期タスク

Samsara-VLA 89.8%449 / 500
Samsara-VLA Tiny 76.0%380 / 500
タスクスイート別の成功率です。各棒は 0 から 100% の範囲を示し、件数は 500 試行中に完了したエピソード数です。

フルモデルは Long の 500 エピソード中 449、Tiny は 380 を完了しました。Object ではそれぞれ 497 と 491 です。こうした内訳により、総合スコアだけではわからないモデル規模と能力の関係が見えてきます。

これは訓練済みのタスクテンプレートを用いた、単一シードの自己報告によるシミュレーション評価です。独立したホールドアウト評価ではありません。実機ロボットや未見のタスクでは未検証です。

モデル規模と能力

コンパクトなポリシーはローカルでの導入を試しやすくします。表では公開した2モデルと公表済みの LIBERO 結果を並べ、すべての行にモデル規模を示しています。レイテンシやメモリ使用量の順位を示すものではありません。

モデル規模と LIBERO 成功率
モデルパラメータ数総合成功率
Samsara-VLA単一ポリシー · 各タスク 50 試行 · 当研究所の評価217.43M94.50%
Samsara-VLA Tiny単一ポリシー · 各タスク 50 試行 · 当研究所の評価136.52M89.30%
OpenVLA-OFT · unified 2 ビュー + 州·1 つのポリシー·公開済み7B ベースモデル96.8%
π₀ 2 ビュー + 州·公開3.3B94.2%
SmolVLA · 450M マルチタスク・10回の試行/タスク・各アクションの再計画450M87.3%
OpenVLA 1 ビュー·公開7B76.5%

公表済みの参考結果であり、条件を揃えた再評価ではありません。カメラ入力、訓練データ、ポリシー共有、試行回数が異なります。Samsara のパラメータ数には凍結部分を含み、参考モデルの規模は引用論文に従います。

ポリシーの動作の仕組み

指示は何をするかを伝え、カメラは現在の状況を映します。記憶は次の判断へ文脈を引き継ぎます。新しい視覚特徴と履歴を合わせて、次の動作列を決めます。

Samsara-VLA / 観測、記憶、動作

現在のビジョン、永続的な歴史。

  1. 01 / 観察

    2 つのビューからシーンを読み取ります。

    シーンカメラがキャビネットの位置を特定します。リストカメラはグリッパーからの眺めを示しています。再プランのたびに、256 × 256の画像と指示書の両方がポリシーに入力されます。

    「キャビネットの真ん中の引き出しを開けて。」

    シーンカメラリストカメラ
    収録した引き出しタスク開始時のシーンと手首の視点。
    カメラ視点 + 指示 + ロボット状態

    ↻ 再び観察する。エピソードが終わるまで履歴を保持。

    同じ収録エピソードのシーンと手首の視点。
  2. 02 / 記憶

    空間的な詳細を失わずに履歴を更新できます。

    2 つの反復ブロックは、以前の観測とロボットの状態を要約します。1 つの履歴トークンが、現在の画像特徴とともにアクションデコーダに届きます。これらの特徴は空間の詳細を保持します。

    「キャビネットの真ん中の引き出しを開けて。」

    以前の観測

    コンパクトな再帰状態

    現在のカメラ視点 + 記憶

    次の判断のための文脈

    ↻ 再び観察する。エピソードが終わるまで履歴を保持。

    保持される文脈の模式図です。学習された記憶の値を可視化したものではありません。
  3. 03 / 行動

    短い一連のアクションを予測します。

    デコーダーは 12 個のアクションを予測します。各アクションには、位置、回転、グリッパーの 7 つの制御値があります。コントローラは、ポリシーに別のチャンクを要求する前にチャンクを実行します。

    「キャビネットの真ん中の引き出しを開けて。」

    一回の予測 / 十二のアクション

    01
    02
    03
    04
    05
    06
    07
    08
    09
    10
    11
    12
    位置回転グリッパー

    アクションの構造を示す模式図。各列は一つの制御ステップです。

    ↻ 再び観察する。エピソードが終わるまで履歴を保持。

    12個の動作それぞれに7つの制御値があります。図は出力の構造を示しています。
  4. 04 / 反復

    履歴を保ち、再び観察する。

    新しいカメラ画像は現在のビューを更新します。履歴キャッシュは、エピソードが増えて次のエピソードでリセットされても、同じ形を保ちます。それが成功に及ぼす効果には、やはり相応のアブレーションが必要です。

    「キャビネットの真ん中の引き出しを開けて。」

    シーンカメラリストカメラ
    モデルが引き出しタスクを完了した後のシーンと手首の視点。
    新しい観測 + 保持した履歴

    ↻ 再び観察する。エピソードが終わるまで履歴を保持。

    この収録例では引き出しタスクが完了します。次のエピソードではポリシーの履歴をリセットします。

カメラ画像は、公開モデルが引き出しを操作したエピソードから取得しています。記憶と動作の図はインターフェースの説明であり、記憶の因果的な効果を測定したものではありません。

お使いの端末で実行

同じポリシーを Python SDK で CPU または CUDA 上で実行でき、ONNX を通じてブラウザでも実行できます。ブラウザは利用可能なら WebGPU を、そうでなければ WebAssembly CPU を使います。モデル読み込み後の推論はローカルで動作し、予測サービスを必要としません。

ブラウザプレビューはネイティブのベンチマークとは別のデモです。固定シーンでの CPU 検証では、フルモデルがボウルと引き出しの両タスクを完了しました。Tiny はボウルを完了し、引き出しでは時間制限に達しました。これらはブラウザでの成功率やレイテンシの測定ではありません。

モデルとブラウザプレビューには現在、研究利用の申請が必要です。EUPE 由来の重みには FAIR Noncommercial Research License が引き続き適用されます。評価プロトコル、アーキテクチャ、デプロイ要件は完全版モデルカードに記載しています。

研究利用の申請

Samsara を研究に。

モデル利用、ブラウザプレビュー、研究協力についてお問い合わせください。

research@goodailabs.com