Aprendizado robótico
Apresentamos Samsara-VLA
Controle robótico com memória, em dois modelos compactos.
Da instrução à tarefa concluída
Samsara-VLA acima. Samsara-VLA Tiny abaixo. Todas as categorias à vista.
Espacial
Encontrar o objeto descrito pela sua posição.
Samsara-VLA
“Pegue a tigela preta entre o prato e o ramequim e coloque-a no prato”
Samsara-VLA Tiny
“Pegue a tigela preta entre o prato e o ramequim e coloque-a no prato”
Objetos
Selecionar o objeto indicado entre outros objetos.
Samsara-VLA
“Pegue o cream cheese e coloque-o na cesta”
Samsara-VLA Tiny
“Pegue o cream cheese e coloque-o na cesta”
Objetivos
Modificar a cena conforme a instrução.
Samsara-VLA
“Abra a gaveta do meio do armário”
Samsara-VLA Tiny
“Abra a gaveta do meio do armário”
Sequências
Executar uma instrução com várias ações.
Samsara-VLA
“Coloque a sopa de letrinhas e a caixa de cream cheese na cesta”
Samsara-VLA Tiny
“Coloque a sopa de letrinhas e a caixa de cream cheese na cesta”
Samsara-VLA é uma política robótica que preserva o contexto entre observações. Usa duas vistas de câmera e uma instrução para pegar, colocar, abrir e completar sequências de ações. Os vídeos acima mostram episódios completos e bem-sucedidos dos dois modelos publicados.
Dois tamanhos. Uma interface de política.
O Samsara-VLA, com 217M parâmetros, concluiu 1,890 de 2,000 episódios nativos do LIBERO. O Samsara-VLA Tiny usa 136M parâmetros e concluiu 1,786 sob o mesmo protocolo de avaliação.
Modelo completo
Samsara-VLA
- Sucesso nativo no LIBERO
- 94.50%
- Parâmetros
- 217.43M
1,890 / 2,000 episódios bem-sucedidos
Modelo compacto
Samsara-VLA Tiny
- Sucesso nativo no LIBERO
- 89.30%
- Parâmetros
- 136.52M
1,786 / 2,000 episódios bem-sucedidos
A diferença é mais clara nas tarefas longas: 89.8% de sucesso no modelo completo e 76.0% no Tiny. A seleção de objetos continua forte nos dois, com 99.4% e 98.2%. O Tiny reduz os parâmetros em 37.2%.
Contexto entre ações
Cada decisão combina uma nova vista da cena com uma memória compacta das observações anteriores. A política prevê doze ações de controle, executa-as e observa novamente. A memória é reiniciada ao começar uma nova tarefa.
Uma política para rodar localmente
Os dois modelos compartilham um SDK Python para CPU e CUDA, com exportações ONNX para inferência no navegador. Após carregar o modelo, a prévia roda no seu dispositivo com WebGPU ou WebAssembly CPU.
São políticas experimentais de simulação. Os resultados nativos cobrem quarenta modelos de tarefas de treinamento com uma semente de avaliação; as demonstrações no navegador são separadas. Os modelos e a prévia estão disponíveis mediante acesso para pesquisa. Consulte o cartão completo do modelo para métodos e limitações, ou a página de pesquisa para resultados por conjunto e comparações com modelos publicados.
DETALHES DO MODELO
Samsara-VLA
Controle robótico com memória recorrente: 217M parâmetros e 94.50% de sucesso no LIBERO nativo.