简
联系
菜单

研究 实验阶段

Samsara-VLA

带记忆的机器人控制。

两个用于语言条件操作的紧凑机器人策略。观看它们抓取、放置、打开并完成多步骤任务。

Samsara-VLA / 实际表现
两个模型,四类操作。 从两个已发布检查点中选出的成功回合,同时展示场景相机与腕部相机。 完整记录的动作,在原始仿真器中重放。播放遵循仿真时间,不包含推理等待。成功率由完整评测计算。

两个模型,同一接口

Samsara-VLA 将相机图像、英文指令和机器人状态转化为连续控制。它在观测之间保留紧凑记忆,一次预测十二个动作。Samsara-VLA Tiny 使用相同接口,视觉编码器更小。

完整模型

Samsara-VLA

原生 LIBERO 成功率
94.50%
参数量
217.43M

1,890 / 2,000 成功回合

紧凑模型

Samsara-VLA Tiny

原生 LIBERO 成功率
89.30%
参数量
136.52M

1,786 / 2,000 成功回合

Tiny 的参数量减少 37.2%,总体成功率相差 5.2 个百分点。两者的参数量均包含冻结的文本编码器,均训练了 40,000 次更新,累计 5.12 百万次监督样本呈现。

原生 LIBERO 结果

我们在 40 个任务、2,000 个回合上评测了每个已发布检查点。每个任务使用五十个官方初始状态。物体选择是两个模型表现最强的套件;较长序列则呈现最大的差异。

Samsara-VLASamsara-VLA Tiny

空间

Samsara-VLA 94.2%471 / 500
Samsara-VLA Tiny 89.8%449 / 500

物体

Samsara-VLA 99.4%497 / 500
Samsara-VLA Tiny 98.2%491 / 500

目标

Samsara-VLA 94.6%473 / 500
Samsara-VLA Tiny 93.2%466 / 500

长序列

Samsara-VLA 89.8%449 / 500
Samsara-VLA Tiny 76.0%380 / 500
各任务套件的成功率。每条柱形的范围为 0 至 100%;计数表示 500 次试验中完成的回合数。

完整模型完成了 500 个 Long 回合中的 449 个,Tiny 完成 380 个。在 Object 上,两者分别完成 497 和 491 个。这些计数比单一总分更清楚地呈现模型大小与能力的取舍。

这是一项自行报告的单随机种子仿真评测,使用训练中见过的任务模板,并非独立留出测试。尚未验证实体机器人或未见任务上的表现。

模型规模与能力

紧凑策略使本地部署更便于探索。表格将我们发布的两个模型与已发表的 LIBERO 结果并列,并列出每个模型的参数量。这不是延迟或内存使用排名。

模型规模与 LIBERO 成功率
模型参数量总体成功率
Samsara-VLA单一策略 · 每任务 50 次试验 · 我们的评测217.43M94.50%
Samsara-VLA Tiny单一策略 · 每任务 50 次试验 · 我们的评测136.52M89.30%
OpenVLA-OFT · unified 2 次观看 + 州·一项政策·已发布7B 基础模型96.8%
π₀ 2 次观看 + 状态·已发布3.3B94.2%
SmolVLA · 450M 多任务·10 次试用/任务·重新计划每项行动450M87.3%
OpenVLA 1 次观看·已发布7B76.5%

已发表的参考结果,并非在相同条件下重新评测。相机输入、训练数据、策略共享方式和试验次数不同。Samsara 参数量包含冻结组件;参考模型大小依据所引用论文。

策略如何行动

指令说明要做什么,相机呈现当前场景。记忆将上下文带入下一次决策,新的视觉特征与历史信息共同决定接下来的动作序列。

Samsara-VLA / 观测、记忆、行动

当前的愿景,不变的历史。

  1. 01 / 观察

    从两个视角阅读场景。

    场景摄像机定位机柜。手腕摄像头显示抓手的视图。每次重新规划时,256 × 256 图像和指令都会输入策略。

    “打开机柜的中间抽屉。”

    场景摄像机手腕相机
    抽屉任务录像开始时的场景与腕部视角。
    相机画面 + 指令 + 机器人状态

    ↻ 再次观察。保留历史,直到回合结束。

    同一录像回合中的场景与腕部视角。
  2. 02 / 记忆

    在不丢失空间细节的情况下更新历史记录。

    两个循环方块总结了先前的观察结果和机器人状态。一个历史代币与当前图像特征一起到达动作解码器,后者保留了其空间细节。

    “打开机柜的中间抽屉。”

    先前的观测

    紧凑循环状态

    当前相机画面 + 记忆

    下一次决策的上下文

    ↻ 再次观察。保留历史,直到回合结束。

    保留上下文的示意图,并非学到的记忆值的可视化。
  3. 03 / 行动

    预测一连串的动作。

    解码器可预测十二个动作,每个动作都有七个位置、旋转和抓手控制值。控制器先执行该区块,然后再向策略请求另一个区块。

    “打开机柜的中间抽屉。”

    一次预测 / 十二个动作

    01
    02
    03
    04
    05
    06
    07
    08
    09
    10
    11
    12
    位置旋转夹爪

    动作结构示意。每列代表一个控制步骤。

    ↻ 再次观察。保留历史,直到回合结束。

    十二个动作,每个包含七个控制值。示意图展示输出结构。
  4. 04 / 重复

    保留历史,再次观察。

    新的相机图像会更新当前视图。随着回合的增长并在下一集重置,历史缓存会保持相同的形状。它对成功的影响仍然需要相应的消融。

    “打开机柜的中间抽屉。”

    场景摄像机手腕相机
    模型完成抽屉任务后的场景与腕部视角。
    新观测 + 保留的历史

    ↻ 再次观察。保留历史,直到回合结束。

    这段录像展示抽屉任务完成。策略会为下一个回合重置历史。

相机画面取自已发布模型的一次抽屉任务。记忆与动作示意图用于说明接口,并不衡量记忆带来的因果收益。

在你的设备上运行

同一策略可通过 Python SDK 在 CPU 或 CUDA 上运行,也可通过 ONNX 在浏览器中运行。浏览器优先使用 WebGPU,否则使用 WebAssembly CPU。模型加载后,推理完全在本地执行,无需预测服务。

浏览器预览与原生基准测试是两项独立演示。在固定场景的 CPU 检查中,完整模型完成了碗和抽屉任务;Tiny 完成了碗任务,但在抽屉任务中达到时间上限。这些检查不是浏览器成功率或延迟测量。

模型和浏览器预览目前需要申请研究访问。基于 EUPE 的权重沿用 FAIR 非商业研究许可。完整模型卡介绍了评测协议、架构与部署要求。

研究访问

与 Samsara 一起研究。

联系我们以申请模型访问、浏览器预览或研究合作。

research@goodailabs.com