从指令到任务完成
上方为 Samsara-VLA,下方为 Samsara-VLA Tiny。各类别同时呈现。
空间
根据位置描述找到物体。
Samsara-VLA
“拿起盘子和小烤碗之间的黑碗,将它放在盘子上”
Samsara-VLA Tiny
“拿起盘子和小烤碗之间的黑碗,将它放在盘子上”
物体
从多个物体中选出指令指定的物体。
Samsara-VLA
“拿起奶油奶酪,将它放入篮子”
Samsara-VLA Tiny
“拿起奶油奶酪,将它放入篮子”
目标
按指令改变场景状态。
Samsara-VLA
“打开柜子中间的抽屉”
Samsara-VLA Tiny
“打开柜子中间的抽屉”
长序列
完成包含多个动作的指令。
Samsara-VLA
“将字母汤罐头和奶油奶酪盒都放入篮子”
Samsara-VLA Tiny
“将字母汤罐头和奶油奶酪盒都放入篮子”
Samsara-VLA 是一种机器人策略,能够在连续观测之间保留上下文。它结合两个相机视角和一条指令,执行抓取、放置、打开及连续动作。上方视频展示了两个已发布模型完成任务的完整成功回合。
两种规模,同一策略接口。
拥有 217M 参数的 Samsara-VLA 完成了 2,000 个原生 LIBERO 回合中的 1,890 个。Samsara-VLA Tiny 使用 136M 参数,在相同评测协议下完成了 1,786 个。
完整模型
Samsara-VLA
- 原生 LIBERO 成功率
- 94.50%
- 参数量
- 217.43M
1,890 / 2,000 成功回合
紧凑模型
Samsara-VLA Tiny
- 原生 LIBERO 成功率
- 89.30%
- 参数量
- 136.52M
1,786 / 2,000 成功回合
差异在较长任务中最为明显:完整模型成功率为 89.8%,Tiny 为 76.0%。两者在物体选择上均表现出色,分别为 99.4% 和 98.2%。Tiny 的参数量减少了 37.2%。
动作之间的上下文
每次决策都会结合当前场景的新观测与先前观测的紧凑记忆。策略预测十二个控制动作,执行后再次观测。开始新任务时,记忆会重置。
可在本地运行的策略
两个模型共用支持 CPU 和 CUDA 执行的 Python SDK,并提供 ONNX 导出用于浏览器推理。浏览器预览在模型加载后,通过 WebGPU 或 WebAssembly CPU 在你的设备上运行。
这些是实验性仿真策略。原生结果涵盖四十个训练任务模板,使用一个评测随机种子;浏览器演示单独进行。模型与预览通过研究访问申请提供。请阅读完整模型卡了解方法和局限,或查看研究页面中的各套件结果及与已发表模型的比较。
型号详情
Samsara-VLA
具有循环记忆的机器人控制策略。217M 参数,原生 LIBERO 成功率为 94.50%。