[研究](https://www.goodailabs.com/zh-cn/research/) 实验阶段 # Samsara-VLA 带记忆的机器人控制。 两个用于语言条件操作的紧凑机器人策略。观看它们抓取、放置、打开并完成多步骤任务。 [查看结果 ↓](https://www.goodailabs.com/#native-libero-results)[阅读公告 ↗](https://www.goodailabs.com/zh-cn/blog/samsara-capability-and-compute/) Samsara-VLA / 实际表现 ## 从指令到任务完成 上方为 Samsara-VLA,下方为 Samsara-VLA Tiny。各类别同时呈现。 ### 空间 根据位置描述找到物体。 Samsara-VLA 场景摄像机手腕相机 [观看 Samsara-VLA · 空间 (MP4)](https://www.goodailabs.com/media/samsara/release/base/spatial.mp4). “拿起盘子和小烤碗之间的黑碗,将它放在盘子上” ✓ 任务完成5.9 秒 Samsara-VLA Tiny 场景摄像机手腕相机 [观看 Samsara-VLA Tiny · 空间 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/spatial.mp4). “拿起盘子和小烤碗之间的黑碗,将它放在盘子上” ✓ 任务完成5.55 秒 ### 物体 从多个物体中选出指令指定的物体。 Samsara-VLA 场景摄像机手腕相机 [观看 Samsara-VLA · 物体 (MP4)](https://www.goodailabs.com/media/samsara/release/base/object.mp4). “拿起奶油奶酪,将它放入篮子” ✓ 任务完成8.2 秒 Samsara-VLA Tiny 场景摄像机手腕相机 [观看 Samsara-VLA Tiny · 物体 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/object.mp4). “拿起奶油奶酪,将它放入篮子” ✓ 任务完成8.45 秒 ### 目标 按指令改变场景状态。 Samsara-VLA 场景摄像机手腕相机 [观看 Samsara-VLA · 目标 (MP4)](https://www.goodailabs.com/media/samsara/release/base/goal.mp4). “打开柜子中间的抽屉” ✓ 任务完成7.8 秒 Samsara-VLA Tiny 场景摄像机手腕相机 [观看 Samsara-VLA Tiny · 目标 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/goal.mp4). “打开柜子中间的抽屉” ✓ 任务完成8.7 秒 ### 长序列 完成包含多个动作的指令。 Samsara-VLA 场景摄像机手腕相机 [观看 Samsara-VLA · 长序列 (MP4)](https://www.goodailabs.com/media/samsara/release/base/long.mp4). “将字母汤罐头和奶油奶酪盒都放入篮子” ✓ 任务完成13.8 秒 Samsara-VLA Tiny 场景摄像机手腕相机 [观看 Samsara-VLA Tiny · 长序列 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/long.mp4). “将字母汤罐头和奶油奶酪盒都放入篮子” ✓ 任务完成13.9 秒 两个模型,四类操作。 从两个已发布检查点中选出的成功回合,同时展示场景相机与腕部相机。 完整记录的动作,在原始仿真器中重放。播放遵循仿真时间,不包含推理等待。成功率由完整评测计算。 ## 两个模型,同一接口 Samsara-VLA 将相机图像、英文指令和机器人状态转化为连续控制。它在观测之间保留紧凑记忆,一次预测十二个动作。Samsara-VLA Tiny 使用相同接口,视觉编码器更小。 完整模型 ### Samsara-VLA 原生 LIBERO 成功率 94.50% 参数量 217.43M 1,890 / 2,000 成功回合 紧凑模型 ### Samsara-VLA Tiny 原生 LIBERO 成功率 89.30% 参数量 136.52M 1,786 / 2,000 成功回合 Tiny 的参数量减少 37.2%,总体成功率相差 5.2 个百分点。两者的参数量均包含冻结的文本编码器,均训练了 40,000 次更新,累计 5.12 百万次监督样本呈现。 ## 原生 LIBERO 结果 我们在 40 个任务、2,000 个回合上评测了每个已发布检查点。每个任务使用五十个官方初始状态。物体选择是两个模型表现最强的套件;较长序列则呈现最大的差异。 Samsara-VLASamsara-VLA Tiny ### 空间 Samsara-VLA 94.2% 471 / 500 Samsara-VLA Tiny 89.8% 449 / 500 ### 物体 Samsara-VLA 99.4% 497 / 500 Samsara-VLA Tiny 98.2% 491 / 500 ### 目标 Samsara-VLA 94.6% 473 / 500 Samsara-VLA Tiny 93.2% 466 / 500 ### 长序列 Samsara-VLA 89.8% 449 / 500 Samsara-VLA Tiny 76.0% 380 / 500 各任务套件的成功率。每条柱形的范围为 0 至 100%;计数表示 500 次试验中完成的回合数。 完整模型完成了 500 个 Long 回合中的 449 个,Tiny 完成 380 个。在 Object 上,两者分别完成 497 和 491 个。这些计数比单一总分更清楚地呈现模型大小与能力的取舍。 这是一项自行报告的单随机种子仿真评测,使用训练中见过的任务模板,并非独立留出测试。尚未验证实体机器人或未见任务上的表现。 ## 模型规模与能力 紧凑策略使本地部署更便于探索。表格将我们发布的两个模型与已发表的 LIBERO 结果并列,并列出每个模型的参数量。这不是延迟或内存使用排名。 模型规模与 LIBERO 成功率 模型 | 参数量 | 总体成功率 | Samsara-VLA单一策略 · 每任务 50 次试验 · 我们的评测 | 217.43M | 94.50% | Samsara-VLA Tiny单一策略 · 每任务 50 次试验 · 我们的评测 | 136.52M | 89.30% | [OpenVLA-OFT · unified ↗](https://arxiv.org/html/2502.19645v2)2 次观看 + 州·一项政策·已发布 | 7B 基础模型 | 96.8% | [π₀ ↗](https://arxiv.org/html/2502.19645v2#S5.T1)2 次观看 + 状态·已发布 | 3.3B | 94.2% | [SmolVLA · 450M ↗](https://arxiv.org/html/2506.01844v1)多任务·10 次试用/任务·重新计划每项行动 | 450M | 87.3% | [OpenVLA ↗](https://arxiv.org/html/2406.09246v3#A5.T12)1 次观看·已发布 | 7B | 76.5% | 已发表的参考结果,并非在相同条件下重新评测。相机输入、训练数据、策略共享方式和试验次数不同。Samsara 参数量包含冻结组件;参考模型大小依据所引用论文。 ## 策略如何行动 指令说明要做什么,相机呈现当前场景。记忆将上下文带入下一次决策,新的视觉特征与历史信息共同决定接下来的动作序列。 Samsara-VLA / 观测、记忆、行动 ### 当前的愿景,不变的历史。 - 01 / 观察 #### 从两个视角阅读场景。 场景摄像机定位机柜。手腕摄像头显示抓手的视图。每次重新规划时,256 × 256 图像和指令都会输入策略。 “打开机柜的中间抽屉。” 场景摄像机手腕相机 抽屉任务录像开始时的场景与腕部视角。 相机画面 + 指令 + 机器人状态 ↻ 再次观察。保留历史,直到回合结束。 同一录像回合中的场景与腕部视角。 - 02 / 记忆 #### 在不丢失空间细节的情况下更新历史记录。 两个循环方块总结了先前的观察结果和机器人状态。一个历史代币与当前图像特征一起到达动作解码器,后者保留了其空间细节。 “打开机柜的中间抽屉。” 先前的观测 → 紧凑循环状态 ↓ 当前相机画面 + 记忆 下一次决策的上下文 ↻ 再次观察。保留历史,直到回合结束。 保留上下文的示意图,并非学到的记忆值的可视化。 - 03 / 行动 #### 预测一连串的动作。 解码器可预测十二个动作,每个动作都有七个位置、旋转和抓手控制值。控制器先执行该区块,然后再向策略请求另一个区块。 “打开机柜的中间抽屉。” 一次预测 / 十二个动作 01 02 03 04 05 06 07 08 09 10 11 12 位置旋转夹爪 动作结构示意。每列代表一个控制步骤。 ↻ 再次观察。保留历史,直到回合结束。 十二个动作,每个包含七个控制值。示意图展示输出结构。 - 04 / 重复 #### 保留历史,再次观察。 新的相机图像会更新当前视图。随着回合的增长并在下一集重置,历史缓存会保持相同的形状。它对成功的影响仍然需要相应的消融。 “打开机柜的中间抽屉。” 场景摄像机手腕相机 模型完成抽屉任务后的场景与腕部视角。 新观测 + 保留的历史 ↻ 再次观察。保留历史,直到回合结束。 这段录像展示抽屉任务完成。策略会为下一个回合重置历史。 相机画面取自已发布模型的一次抽屉任务。记忆与动作示意图用于说明接口,并不衡量记忆带来的因果收益。 ## 在你的设备上运行 同一策略可通过 Python SDK 在 CPU 或 CUDA 上运行,也可通过 ONNX 在浏览器中运行。浏览器优先使用 WebGPU,否则使用 WebAssembly CPU。模型加载后,推理完全在本地执行,无需预测服务。 浏览器预览与原生基准测试是两项独立演示。在固定场景的 CPU 检查中,完整模型完成了碗和抽屉任务;Tiny 完成了碗任务,但在抽屉任务中达到时间上限。这些检查不是浏览器成功率或延迟测量。 模型和浏览器预览目前需要申请研究访问。基于 EUPE 的权重沿用 FAIR 非商业研究许可。[完整模型卡](https://huggingface.co/gai-labs/samsara-vla/blob/main/MODEL_CARD.md)介绍了评测协议、架构与部署要求。 研究访问 ## 与 Samsara 一起研究。 联系我们以申请模型访问、浏览器预览或研究合作。 [research@goodailabs.com](mailto:research@goodailabs.com?subject=Samsara-VLA+research+access)