從指令到任務完成
上方為 Samsara-VLA,下方為 Samsara-VLA Tiny。各類別同時呈現。
空間
根據位置描述找到物件。
Samsara-VLA
“拿起盤子和小烤碗之間的黑碗,將它放在盤子上”
Samsara-VLA Tiny
“拿起盤子和小烤碗之間的黑碗,將它放在盤子上”
物件
從多個物件中選出指令指定的物件。
Samsara-VLA
“拿起奶油乳酪,將它放入籃子”
Samsara-VLA Tiny
“拿起奶油乳酪,將它放入籃子”
目標
依照指令改變場景狀態。
Samsara-VLA
“打開櫃子中間的抽屜”
Samsara-VLA Tiny
“打開櫃子中間的抽屜”
長序列
完成包含多個動作的指令。
Samsara-VLA
“將字母湯罐頭和奶油乳酪盒都放入籃子”
Samsara-VLA Tiny
“將字母湯罐頭和奶油乳酪盒都放入籃子”
Samsara-VLA 是一種機器人策略,能夠在連續觀測之間保留上下文。它結合兩個相機視角和一條指令,執行抓取、放置、開啟及連續動作。上方影片展示了兩個已發布模型完成任務的完整成功回合。
兩種規模,同一策略介面。
擁有 217M 參數的 Samsara-VLA 完成了 2,000 個原生 LIBERO 回合中的 1,890 個。Samsara-VLA Tiny 使用 136M 參數,在相同評測協定下完成了 1,786 個。
完整模型
Samsara-VLA
- 原生 LIBERO 成功率
- 94.50%
- 引數量
- 217.43M
1,890 / 2,000 成功回合
精簡模型
Samsara-VLA Tiny
- 原生 LIBERO 成功率
- 89.30%
- 引數量
- 136.52M
1,786 / 2,000 成功回合
差異在較長任務中最為明顯:完整模型成功率為 89.8%,Tiny 為 76.0%。兩者在物體選擇上均表現出色,分別為 99.4% 和 98.2%。Tiny 的參數量減少了 37.2%。
動作之間的上下文
每次決策都會結合當前場景的新觀測與先前觀測的精簡記憶。策略預測十二個控制動作,執行後再次觀測。開始新任務時,記憶會重設。
可在本機執行的策略
兩個模型共用支援 CPU 與 CUDA 執行的 Python SDK,並提供 ONNX 匯出用於瀏覽器推論。瀏覽器預覽在模型載入後,透過 WebGPU 或 WebAssembly CPU 在你的裝置上執行。
這些是實驗性模擬策略。原生結果涵蓋四十個訓練任務範本,使用一個評測隨機種子;瀏覽器示範另行進行。模型與預覽透過研究存取申請提供。請閱讀完整模型卡了解方法與限制,或查看研究頁面的各套件結果及與已發表模型的比較。
型號詳情
Samsara-VLA
具有循環記憶的機器人控制策略。217M 參數,原生 LIBERO 成功率為 94.50%。