[↖ 研究ノート](https://www.goodailabs.com/ja/blog/) 発表 2026年10月5日 ロボット学習 # Samsara-VLA を発表 記憶を備えたロボット制御を、2つのコンパクトなモデルで。 Good AI Labs · 約 2 分で読めます [モデルと評価 ↗](https://www.goodailabs.com/ja/research/samsara-vla/) [研究利用の申請 ↗](mailto:research@goodailabs.com?subject=Samsara-VLA%20research%20access) Samsara-VLA / 動作例 ## 指示からタスク完了まで 上段は Samsara-VLA、下段は Samsara-VLA Tiny。全カテゴリを並べて表示しています。 ### 空間 位置の説明に合う物体を見つける。 Samsara-VLA シーンカメラリストカメラ [視聴:Samsara-VLA · 空間 (MP4)](https://www.goodailabs.com/media/samsara/release/base/spatial.mp4). “皿とラメキンの間にある黒いボウルを持ち上げて皿に置く” ✓ タスク完了5.9 秒 Samsara-VLA Tiny シーンカメラリストカメラ [視聴:Samsara-VLA Tiny · 空間 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/spatial.mp4). “皿とラメキンの間にある黒いボウルを持ち上げて皿に置く” ✓ タスク完了5.55 秒 ### 物体 複数の物体から指定されたものを選ぶ。 Samsara-VLA シーンカメラリストカメラ [視聴:Samsara-VLA · 物体 (MP4)](https://www.goodailabs.com/media/samsara/release/base/object.mp4). “クリームチーズを持ち上げてかごに入れる” ✓ タスク完了8.2 秒 Samsara-VLA Tiny シーンカメラリストカメラ [視聴:Samsara-VLA Tiny · 物体 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/object.mp4). “クリームチーズを持ち上げてかごに入れる” ✓ タスク完了8.45 秒 ### 目標 指示に合うように環境の状態を変える。 Samsara-VLA シーンカメラリストカメラ [視聴:Samsara-VLA · 目標 (MP4)](https://www.goodailabs.com/media/samsara/release/base/goal.mp4). “キャビネットの中央の引き出しを開ける” ✓ タスク完了7.8 秒 Samsara-VLA Tiny シーンカメラリストカメラ [視聴:Samsara-VLA Tiny · 目標 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/goal.mp4). “キャビネットの中央の引き出しを開ける” ✓ タスク完了8.7 秒 ### 長期タスク 複数の動作を要する指示を実行する。 Samsara-VLA シーンカメラリストカメラ [視聴:Samsara-VLA · 長期 (MP4)](https://www.goodailabs.com/media/samsara/release/base/long.mp4). “アルファベットスープの缶とクリームチーズの箱を両方かごに入れる” ✓ タスク完了13.8 秒 Samsara-VLA Tiny シーンカメラリストカメラ [視聴:Samsara-VLA Tiny · 長期 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/long.mp4). “アルファベットスープの缶とクリームチーズの箱を両方かごに入れる” ✓ タスク完了13.9 秒 2つのモデル、4種類の操作。 公開した両チェックポイントから選んだ成功エピソードです。シーンカメラと手首カメラを並べて表示しています。 記録した動作を元のシミュレータで最初から最後まで再現しています。再生はシミュレーション時間に沿い、推論の待ち時間は含みません。成功率は全評価から算出しています。 Samsara-VLA は、観測から次の観測へ文脈を引き継ぐロボットポリシーです。2つのカメラ視点と指示を使い、つかむ、置く、開けるといった動作や連続した作業を行います。上の動画では、公開した2モデルの成功エピソードを最初から最後まで確認できます。 ## 2つの規模、共通のポリシーインターフェース。 217M パラメータの Samsara-VLA は、ネイティブ LIBERO の 2,000 エピソード中 1,890 を完了しました。Samsara-VLA Tiny は 136M パラメータで、同じ評価プロトコルの下で 1,786 を完了しました。 フルモデル ### Samsara-VLA ネイティブ LIBERO 成功率 94.50% パラメータ数 217.43M 1,890 / 2,000 成功エピソード コンパクトモデル ### Samsara-VLA Tiny ネイティブ LIBERO 成功率 89.30% パラメータ数 136.52M 1,786 / 2,000 成功エピソード 差が最も大きいのは長いタスクです。フルモデルの成功率は 89.8%、Tiny は 76.0% です。物体選択は両方とも高く、それぞれ 99.4% と 98.2%。Tiny はパラメータ数を 37.2% 削減しています。 ## 動作間の文脈 各判断では、シーンの新しい観測と、過去の観測を保持したコンパクトな記憶を組み合わせます。ポリシーは12個の制御動作を予測して実行し、再び観測します。新しいタスクが始まると記憶をリセットします。 ## ローカルで実行できるポリシー 両モデルは CPU と CUDA 実行用の Python SDK を共有し、ブラウザ推論向けの ONNX エクスポートを備えています。ブラウザプレビューはモデル読み込み後、WebGPU または WebAssembly CPU を使って利用者のデバイス上で動作します。 これらは実験段階のシミュレーション用ポリシーです。ネイティブ実行の結果は、訓練済みの40タスクテンプレートを単一の評価シードで測定したものです。ブラウザのデモは別に実施しています。モデルとプレビューは研究利用の申請でアクセスできます。手法と制限は[完全版モデルカード](https://huggingface.co/gai-labs/samsara-vla/blob/main/MODEL_CARD.md)を、スイート別結果と公表モデルとの比較は研究ページをご覧ください。 [モデル詳細 ## Samsara-VLA 再帰的な記憶を持つロボット制御。217M パラメータで、ネイティブ LIBERO 成功率 94.50%。 ↗](https://www.goodailabs.com/ja/research/samsara-vla/) [研究室のその他の情報 ↗](https://www.goodailabs.com/ja/blog/)