繁
聯絡
選單

研究 實驗階段

Samsara-VLA

具備記憶的機器人控制。

兩個用於語言條件操作的精簡機器人策略。觀看它們抓取、放置、開啟並完成多步驟任務。

Samsara-VLA / 實際表現
兩個模型,四類操作。 從兩個已發布檢查點中選出的成功回合,同時展示場景相機與腕部相機。 完整記錄的動作,在原始模擬器中重播。播放遵循模擬時間,不包含推論等待。成功率由完整評測計算。

兩個模型,同一介面

Samsara-VLA 將相機影像、英文指令與機器人狀態轉化為連續控制。它在觀測之間保留精簡記憶,一次預測十二個動作。Samsara-VLA Tiny 使用相同介面,視覺編碼器更小。

完整模型

Samsara-VLA

原生 LIBERO 成功率
94.50%
引數量
217.43M

1,890 / 2,000 成功回合

精簡模型

Samsara-VLA Tiny

原生 LIBERO 成功率
89.30%
引數量
136.52M

1,786 / 2,000 成功回合

Tiny 的參數量減少 37.2%,整體成功率相差 5.2 個百分點。兩者的參數量均包含凍結的文字編碼器,均訓練了 40,000 次更新,累計 5.12 百萬次監督樣本呈現。

原生 LIBERO 結果

我們在 40 個任務、2,000 個回合上評測了每個已發布檢查點。每個任務使用五十個官方初始狀態。物體選擇是兩個模型表現最強的套件;較長序列則呈現最大的差異。

Samsara-VLASamsara-VLA Tiny

空間

Samsara-VLA 94.2%471 / 500
Samsara-VLA Tiny 89.8%449 / 500

物件

Samsara-VLA 99.4%497 / 500
Samsara-VLA Tiny 98.2%491 / 500

目標

Samsara-VLA 94.6%473 / 500
Samsara-VLA Tiny 93.2%466 / 500

長序列

Samsara-VLA 89.8%449 / 500
Samsara-VLA Tiny 76.0%380 / 500
各任務套件的成功率。每條長條的範圍為 0 至 100%;計數表示 500 次試驗中完成的回合數。

完整模型完成了 500 個 Long 回合中的 449 個,Tiny 完成 380 個。在 Object 上,兩者分別完成 497 和 491 個。這些計數比單一總分更清楚地呈現模型大小與能力的取捨。

這是一項自行報告的單隨機種子模擬評測,使用訓練中見過的任務範本,並非獨立保留測試。尚未驗證實體機器人或未見任務上的表現。

模型規模與能力

精簡策略使本機部署更便於探索。表格將我們發布的兩個模型與已發表的 LIBERO 結果並列,並列出每個模型的參數量。這不是延遲或記憶體使用排名。

模型規模與 LIBERO 成功率
模型引數量整體成功率
Samsara-VLA單一策略 · 每任務 50 次試驗 · 我們的評測217.43M94.50%
Samsara-VLA Tiny單一策略 · 每任務 50 次試驗 · 我們的評測136.52M89.30%
OpenVLA-OFT · unified 2 次觀看 + 州·一項政策·已釋出7B 基礎模型96.8%
π₀ 2 次觀看 + 狀態·已釋出3.3B94.2%
SmolVLA · 450M 多工·10 次試用/任務·重新計劃每項行動450M87.3%
OpenVLA 1 次觀看·已釋出7B76.5%

已發表的參考結果,並非在相同條件下重新評測。相機輸入、訓練資料、策略共用方式和試驗次數不同。Samsara 參數量包含凍結元件;參考模型大小依據所引用論文。

策略如何行動

指令說明要做什麼,相機呈現當前場景。記憶將上下文帶入下一次決策,新的視覺特徵與歷史資訊共同決定接下來的動作序列。

Samsara-VLA / 觀測、記憶、行動

當前的願景,不變的歷史。

  1. 01 / 觀察

    從兩個視角閱讀場景。

    場景攝像機定位機櫃。手腕攝像頭顯示抓手的檢視。每次重新規劃時,256 × 256 影象和指令都會輸入策略。

    “開啟機櫃的中間抽屜。”

    場景攝像機手腕相機
    抽屜任務錄影開始時的場景與腕部視角。
    相機畫面 + 指令 + 機器人狀態

    ↻ 再次觀察。保留歷史,直到回合結束。

    同一錄影回合中的場景與腕部視角。
  2. 02 / 記憶

    在不丟失空間細節的情況下更新歷史記錄。

    兩個迴圈方塊總結了先前的觀察結果和機器人狀態。一個歷史代幣與當前影象特徵一起到達動作解碼器,後者保留了其空間細節。

    “開啟機櫃的中間抽屜。”

    先前的觀測

    精簡循環狀態

    當前相機畫面 + 記憶

    下一次決策的上下文

    ↻ 再次觀察。保留歷史,直到回合結束。

    保留上下文的示意圖,並非學得記憶值的視覺化。
  3. 03 / 行動

    預測一連串的動作。

    解碼器可預測十二個動作,每個動作都有七個位置、旋轉和抓手控制值。控制器先執行該區塊,然後再向策略請求另一個區塊。

    “開啟機櫃的中間抽屜。”

    一次預測 / 十二個動作

    01
    02
    03
    04
    05
    06
    07
    08
    09
    10
    11
    12
    位置旋轉夾爪

    動作結構示意。每列代表一個控制步驟。

    ↻ 再次觀察。保留歷史,直到回合結束。

    十二個動作,每個包含七個控制值。示意圖展示輸出結構。
  4. 04 / 重複

    保留歷史,再次觀察。

    新的相機影象會更新當前檢視。隨著回合的增長並在下一集重置,歷史快取會保持相同的形狀。它對成功的影響仍然需要相應的消融。

    “開啟機櫃的中間抽屜。”

    場景攝像機手腕相機
    模型完成抽屜任務後的場景與腕部視角。
    新觀測 + 保留的歷史

    ↻ 再次觀察。保留歷史,直到回合結束。

    這段錄影展示抽屜任務完成。策略會為下一個回合重設歷史。

相機畫面取自已發布模型的一次抽屜任務。記憶與動作示意圖用於說明介面,並不衡量記憶帶來的因果效益。

在你的裝置上執行

同一策略可透過 Python SDK 在 CPU 或 CUDA 上執行,也可透過 ONNX 在瀏覽器中執行。瀏覽器優先使用 WebGPU,否則使用 WebAssembly CPU。模型載入後,推論完全在本機執行,無需預測服務。

瀏覽器預覽與原生基準測試分開進行。在固定場景的 CPU 檢查中,完整模型完成了碗與抽屜任務;Tiny 完成了碗任務,但在抽屜任務中達到時間上限。這些檢查不是瀏覽器成功率或延遲測量。

模型與瀏覽器預覽目前需要申請研究存取。基於 EUPE 的權重沿用 FAIR 非商業研究授權。完整模型卡介紹了評測協定、架構與部署需求。

研究存取

與 Samsara 一起研究。

聯絡我們以申請模型存取、瀏覽器預覽或研究合作。

research@goodailabs.com