[↖ 研究日志](https://www.goodailabs.com/zh-cn/blog/) 公告 2026年10月5日 机器人学习 # Samsara-VLA 发布公告 两个紧凑模型,让机器人控制拥有记忆。 Good AI Labs · 阅读约 2 分钟 [模型与评估 ↗](https://www.goodailabs.com/zh-cn/research/samsara-vla/) [研究访问 ↗](mailto:research@goodailabs.com?subject=Samsara-VLA%20research%20access) Samsara-VLA / 实际表现 ## 从指令到任务完成 上方为 Samsara-VLA,下方为 Samsara-VLA Tiny。各类别同时呈现。 ### 空间 根据位置描述找到物体。 Samsara-VLA 场景摄像机手腕相机 [观看 Samsara-VLA · 空间 (MP4)](https://www.goodailabs.com/media/samsara/release/base/spatial.mp4). “拿起盘子和小烤碗之间的黑碗,将它放在盘子上” ✓ 任务完成5.9 秒 Samsara-VLA Tiny 场景摄像机手腕相机 [观看 Samsara-VLA Tiny · 空间 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/spatial.mp4). “拿起盘子和小烤碗之间的黑碗,将它放在盘子上” ✓ 任务完成5.55 秒 ### 物体 从多个物体中选出指令指定的物体。 Samsara-VLA 场景摄像机手腕相机 [观看 Samsara-VLA · 物体 (MP4)](https://www.goodailabs.com/media/samsara/release/base/object.mp4). “拿起奶油奶酪,将它放入篮子” ✓ 任务完成8.2 秒 Samsara-VLA Tiny 场景摄像机手腕相机 [观看 Samsara-VLA Tiny · 物体 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/object.mp4). “拿起奶油奶酪,将它放入篮子” ✓ 任务完成8.45 秒 ### 目标 按指令改变场景状态。 Samsara-VLA 场景摄像机手腕相机 [观看 Samsara-VLA · 目标 (MP4)](https://www.goodailabs.com/media/samsara/release/base/goal.mp4). “打开柜子中间的抽屉” ✓ 任务完成7.8 秒 Samsara-VLA Tiny 场景摄像机手腕相机 [观看 Samsara-VLA Tiny · 目标 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/goal.mp4). “打开柜子中间的抽屉” ✓ 任务完成8.7 秒 ### 长序列 完成包含多个动作的指令。 Samsara-VLA 场景摄像机手腕相机 [观看 Samsara-VLA · 长序列 (MP4)](https://www.goodailabs.com/media/samsara/release/base/long.mp4). “将字母汤罐头和奶油奶酪盒都放入篮子” ✓ 任务完成13.8 秒 Samsara-VLA Tiny 场景摄像机手腕相机 [观看 Samsara-VLA Tiny · 长序列 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/long.mp4). “将字母汤罐头和奶油奶酪盒都放入篮子” ✓ 任务完成13.9 秒 两个模型,四类操作。 从两个已发布检查点中选出的成功回合,同时展示场景相机与腕部相机。 完整记录的动作,在原始仿真器中重放。播放遵循仿真时间,不包含推理等待。成功率由完整评测计算。 Samsara-VLA 是一种机器人策略,能够在连续观测之间保留上下文。它结合两个相机视角和一条指令,执行抓取、放置、打开及连续动作。上方视频展示了两个已发布模型完成任务的完整成功回合。 ## 两种规模,同一策略接口。 拥有 217M 参数的 Samsara-VLA 完成了 2,000 个原生 LIBERO 回合中的 1,890 个。Samsara-VLA Tiny 使用 136M 参数,在相同评测协议下完成了 1,786 个。 完整模型 ### Samsara-VLA 原生 LIBERO 成功率 94.50% 参数量 217.43M 1,890 / 2,000 成功回合 紧凑模型 ### Samsara-VLA Tiny 原生 LIBERO 成功率 89.30% 参数量 136.52M 1,786 / 2,000 成功回合 差异在较长任务中最为明显:完整模型成功率为 89.8%,Tiny 为 76.0%。两者在物体选择上均表现出色,分别为 99.4% 和 98.2%。Tiny 的参数量减少了 37.2%。 ## 动作之间的上下文 每次决策都会结合当前场景的新观测与先前观测的紧凑记忆。策略预测十二个控制动作,执行后再次观测。开始新任务时,记忆会重置。 ## 可在本地运行的策略 两个模型共用支持 CPU 和 CUDA 执行的 Python SDK,并提供 ONNX 导出用于浏览器推理。浏览器预览在模型加载后,通过 WebGPU 或 WebAssembly CPU 在你的设备上运行。 这些是实验性仿真策略。原生结果涵盖四十个训练任务模板,使用一个评测随机种子;浏览器演示单独进行。模型与预览通过研究访问申请提供。请阅读[完整模型卡](https://huggingface.co/gai-labs/samsara-vla/blob/main/MODEL_CARD.md)了解方法和局限,或查看研究页面中的各套件结果及与已发表模型的比较。 [型号详情 ## Samsara-VLA 具有循环记忆的机器人控制策略。217M 参数,原生 LIBERO 成功率为 94.50%。 ↗](https://www.goodailabs.com/zh-cn/research/samsara-vla/) [来自实验室的更多内容 ↗](https://www.goodailabs.com/zh-cn/blog/)