Aprendizaje robótico
Presentamos Samsara-VLA
Control robótico con memoria, en dos modelos compactos.
De la instrucción a la tarea completada
Samsara-VLA arriba. Samsara-VLA Tiny abajo. Todas las categorías a la vista.
Espacial
Encontrar el objeto descrito por su posición.
Samsara-VLA
“Recoge el bol negro entre el plato y el ramequín y colócalo en el plato”
Samsara-VLA Tiny
“Recoge el bol negro entre el plato y el ramequín y colócalo en el plato”
Objetos
Seleccionar el objeto indicado entre otros objetos.
Samsara-VLA
“Recoge el queso crema y colócalo en la cesta”
Samsara-VLA Tiny
“Recoge el queso crema y colócalo en la cesta”
Objetivos
Modificar la escena según la instrucción.
Samsara-VLA
“Abre el cajón central del armario”
Samsara-VLA Tiny
“Abre el cajón central del armario”
Secuencias
Ejecutar una instrucción con varias acciones.
Samsara-VLA
“Pon la sopa de letras y la caja de queso crema en la cesta”
Samsara-VLA Tiny
“Pon la sopa de letras y la caja de queso crema en la cesta”
Samsara-VLA es una política robótica que conserva el contexto entre observaciones. Utiliza dos vistas de cámara y una instrucción para recoger, colocar, abrir y completar secuencias de acciones. Los vídeos de arriba muestran episodios completos y exitosos de los dos modelos publicados.
Dos tamaños. Una interfaz de política.
Samsara-VLA, con 217M parámetros, completó 1,890 de 2,000 episodios nativos de LIBERO. Samsara-VLA Tiny utiliza 136M parámetros y completó 1,786 con el mismo protocolo de evaluación.
Modelo completo
Samsara-VLA
- Éxito nativo en LIBERO
- 94.50%
- Parámetros
- 217.43M
1,890 / 2,000 episodios exitosos
Modelo compacto
Samsara-VLA Tiny
- Éxito nativo en LIBERO
- 89.30%
- Parámetros
- 136.52M
1,786 / 2,000 episodios exitosos
La diferencia es más clara en tareas largas: 89.8% de éxito para el modelo completo y 76.0% para Tiny. Ambos mantienen buenos resultados en selección de objetos, con 99.4% y 98.2%. Tiny reduce los parámetros un 37.2%.
Contexto entre acciones
Cada decisión combina una vista actual de la escena con una memoria compacta de observaciones anteriores. La política predice doce acciones de control, las ejecuta y vuelve a observar. La memoria se reinicia al comenzar una nueva tarea.
Una política que se ejecuta localmente
Ambos modelos comparten un SDK de Python para CPU y CUDA, con exportaciones ONNX para inferencia en el navegador. Tras cargar el modelo, la vista previa se ejecuta en su dispositivo mediante WebGPU o WebAssembly CPU.
Son políticas experimentales de simulación. Los resultados nativos cubren cuarenta plantillas de tareas entrenadas con una semilla de evaluación; las demostraciones de navegador son independientes. Los modelos y la vista previa están disponibles mediante acceso para investigación. Consulte la ficha completa del modelo para conocer métodos y limitaciones, o la página de investigación para ver resultados por suite y comparaciones con modelos publicados.
DETALLES DEL MODELO
Samsara-VLA
Control robótico con memoria recurrente: 217M parámetros y 94.50% de éxito en LIBERO nativo.