[↖ 研究日誌](https://www.goodailabs.com/zh-tw/blog/) 公告 2026年10月5日 機器人學習 # Samsara-VLA 發布公告 兩個精簡模型,讓機器人控制擁有記憶。 Good AI Labs · 閱讀約 2 分鐘 [模型與評估 ↗](https://www.goodailabs.com/zh-tw/research/samsara-vla/) [研究存取 ↗](mailto:research@goodailabs.com?subject=Samsara-VLA%20research%20access) Samsara-VLA / 實際表現 ## 從指令到任務完成 上方為 Samsara-VLA,下方為 Samsara-VLA Tiny。各類別同時呈現。 ### 空間 根據位置描述找到物件。 Samsara-VLA 場景攝像機手腕相機 [觀看 Samsara-VLA · 空間 (MP4)](https://www.goodailabs.com/media/samsara/release/base/spatial.mp4). “拿起盤子和小烤碗之間的黑碗,將它放在盤子上” ✓ 任務完成5.9 秒 Samsara-VLA Tiny 場景攝像機手腕相機 [觀看 Samsara-VLA Tiny · 空間 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/spatial.mp4). “拿起盤子和小烤碗之間的黑碗,將它放在盤子上” ✓ 任務完成5.55 秒 ### 物件 從多個物件中選出指令指定的物件。 Samsara-VLA 場景攝像機手腕相機 [觀看 Samsara-VLA · 物體 (MP4)](https://www.goodailabs.com/media/samsara/release/base/object.mp4). “拿起奶油乳酪,將它放入籃子” ✓ 任務完成8.2 秒 Samsara-VLA Tiny 場景攝像機手腕相機 [觀看 Samsara-VLA Tiny · 物體 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/object.mp4). “拿起奶油乳酪,將它放入籃子” ✓ 任務完成8.45 秒 ### 目標 依照指令改變場景狀態。 Samsara-VLA 場景攝像機手腕相機 [觀看 Samsara-VLA · 目標 (MP4)](https://www.goodailabs.com/media/samsara/release/base/goal.mp4). “打開櫃子中間的抽屜” ✓ 任務完成7.8 秒 Samsara-VLA Tiny 場景攝像機手腕相機 [觀看 Samsara-VLA Tiny · 目標 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/goal.mp4). “打開櫃子中間的抽屜” ✓ 任務完成8.7 秒 ### 長序列 完成包含多個動作的指令。 Samsara-VLA 場景攝像機手腕相機 [觀看 Samsara-VLA · 長序列 (MP4)](https://www.goodailabs.com/media/samsara/release/base/long.mp4). “將字母湯罐頭和奶油乳酪盒都放入籃子” ✓ 任務完成13.8 秒 Samsara-VLA Tiny 場景攝像機手腕相機 [觀看 Samsara-VLA Tiny · 長序列 (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/long.mp4). “將字母湯罐頭和奶油乳酪盒都放入籃子” ✓ 任務完成13.9 秒 兩個模型,四類操作。 從兩個已發布檢查點中選出的成功回合,同時展示場景相機與腕部相機。 完整記錄的動作,在原始模擬器中重播。播放遵循模擬時間,不包含推論等待。成功率由完整評測計算。 Samsara-VLA 是一種機器人策略,能夠在連續觀測之間保留上下文。它結合兩個相機視角和一條指令,執行抓取、放置、開啟及連續動作。上方影片展示了兩個已發布模型完成任務的完整成功回合。 ## 兩種規模,同一策略介面。 擁有 217M 參數的 Samsara-VLA 完成了 2,000 個原生 LIBERO 回合中的 1,890 個。Samsara-VLA Tiny 使用 136M 參數,在相同評測協定下完成了 1,786 個。 完整模型 ### Samsara-VLA 原生 LIBERO 成功率 94.50% 引數量 217.43M 1,890 / 2,000 成功回合 精簡模型 ### Samsara-VLA Tiny 原生 LIBERO 成功率 89.30% 引數量 136.52M 1,786 / 2,000 成功回合 差異在較長任務中最為明顯:完整模型成功率為 89.8%,Tiny 為 76.0%。兩者在物體選擇上均表現出色,分別為 99.4% 和 98.2%。Tiny 的參數量減少了 37.2%。 ## 動作之間的上下文 每次決策都會結合當前場景的新觀測與先前觀測的精簡記憶。策略預測十二個控制動作,執行後再次觀測。開始新任務時,記憶會重設。 ## 可在本機執行的策略 兩個模型共用支援 CPU 與 CUDA 執行的 Python SDK,並提供 ONNX 匯出用於瀏覽器推論。瀏覽器預覽在模型載入後,透過 WebGPU 或 WebAssembly CPU 在你的裝置上執行。 這些是實驗性模擬策略。原生結果涵蓋四十個訓練任務範本,使用一個評測隨機種子;瀏覽器示範另行進行。模型與預覽透過研究存取申請提供。請閱讀[完整模型卡](https://huggingface.co/gai-labs/samsara-vla/blob/main/MODEL_CARD.md)了解方法與限制,或查看研究頁面的各套件結果及與已發表模型的比較。 [型號詳情 ## Samsara-VLA 具有循環記憶的機器人控制策略。217M 參數,原生 LIBERO 成功率為 94.50%。 ↗](https://www.goodailabs.com/zh-tw/research/samsara-vla/) [來自實驗室的更多內容 ↗](https://www.goodailabs.com/zh-tw/blog/)