[↖ Publicaciones](https://www.goodailabs.com/es/blog/) ANUNCIO 5 de octubre de 2026 Aprendizaje robótico # Presentamos Samsara-VLA Control robótico con memoria, en dos modelos compactos. Good AI Labs · 2 min de lectura [Modelo y evaluación ↗](https://www.goodailabs.com/es/research/samsara-vla/) [Acceso para investigación ↗](mailto:research@goodailabs.com?subject=Samsara-VLA%20research%20access) Samsara-VLA / En acción ## De la instrucción a la tarea completada Samsara-VLA arriba. Samsara-VLA Tiny abajo. Todas las categorías a la vista. ### Espacial Encontrar el objeto descrito por su posición. Samsara-VLA Cámara de escenaCámara de muñeca [Ver Samsara-VLA · Espacial (MP4)](https://www.goodailabs.com/media/samsara/release/base/spatial.mp4). “Recoge el bol negro entre el plato y el ramequín y colócalo en el plato” ✓ Tarea completada5.9 S Samsara-VLA Tiny Cámara de escenaCámara de muñeca [Ver Samsara-VLA Tiny · Espacial (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/spatial.mp4). “Recoge el bol negro entre el plato y el ramequín y colócalo en el plato” ✓ Tarea completada5.55 S ### Objetos Seleccionar el objeto indicado entre otros objetos. Samsara-VLA Cámara de escenaCámara de muñeca [Ver Samsara-VLA · Objetos (MP4)](https://www.goodailabs.com/media/samsara/release/base/object.mp4). “Recoge el queso crema y colócalo en la cesta” ✓ Tarea completada8.2 S Samsara-VLA Tiny Cámara de escenaCámara de muñeca [Ver Samsara-VLA Tiny · Objetos (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/object.mp4). “Recoge el queso crema y colócalo en la cesta” ✓ Tarea completada8.45 S ### Objetivos Modificar la escena según la instrucción. Samsara-VLA Cámara de escenaCámara de muñeca [Ver Samsara-VLA · Objetivo (MP4)](https://www.goodailabs.com/media/samsara/release/base/goal.mp4). “Abre el cajón central del armario” ✓ Tarea completada7.8 S Samsara-VLA Tiny Cámara de escenaCámara de muñeca [Ver Samsara-VLA Tiny · Objetivo (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/goal.mp4). “Abre el cajón central del armario” ✓ Tarea completada8.7 S ### Secuencias Ejecutar una instrucción con varias acciones. Samsara-VLA Cámara de escenaCámara de muñeca [Ver Samsara-VLA · Secuencias largas (MP4)](https://www.goodailabs.com/media/samsara/release/base/long.mp4). “Pon la sopa de letras y la caja de queso crema en la cesta” ✓ Tarea completada13.8 S Samsara-VLA Tiny Cámara de escenaCámara de muñeca [Ver Samsara-VLA Tiny · Secuencias largas (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/long.mp4). “Pon la sopa de letras y la caja de queso crema en la cesta” ✓ Tarea completada13.9 S Dos modelos. Cuatro tipos de manipulación. Episodios exitosos seleccionados de ambos checkpoints publicados. Se muestran juntas las cámaras de escena y muñeca. Acciones completas registradas y reproducidas en el simulador original. La reproducción sigue el tiempo de simulación y excluye las esperas de inferencia. Las tasas de éxito proceden de la evaluación completa. Samsara-VLA es una política robótica que conserva el contexto entre observaciones. Utiliza dos vistas de cámara y una instrucción para recoger, colocar, abrir y completar secuencias de acciones. Los vídeos de arriba muestran episodios completos y exitosos de los dos modelos publicados. ## Dos tamaños. Una interfaz de política. Samsara-VLA, con 217M parámetros, completó 1,890 de 2,000 episodios nativos de LIBERO. Samsara-VLA Tiny utiliza 136M parámetros y completó 1,786 con el mismo protocolo de evaluación. Modelo completo ### Samsara-VLA Éxito nativo en LIBERO 94.50% Parámetros 217.43M 1,890 / 2,000 episodios exitosos Modelo compacto ### Samsara-VLA Tiny Éxito nativo en LIBERO 89.30% Parámetros 136.52M 1,786 / 2,000 episodios exitosos La diferencia es más clara en tareas largas: 89.8% de éxito para el modelo completo y 76.0% para Tiny. Ambos mantienen buenos resultados en selección de objetos, con 99.4% y 98.2%. Tiny reduce los parámetros un 37.2%. ## Contexto entre acciones Cada decisión combina una vista actual de la escena con una memoria compacta de observaciones anteriores. La política predice doce acciones de control, las ejecuta y vuelve a observar. La memoria se reinicia al comenzar una nueva tarea. ## Una política que se ejecuta localmente Ambos modelos comparten un SDK de Python para CPU y CUDA, con exportaciones ONNX para inferencia en el navegador. Tras cargar el modelo, la vista previa se ejecuta en su dispositivo mediante WebGPU o WebAssembly CPU. Son políticas experimentales de simulación. Los resultados nativos cubren cuarenta plantillas de tareas entrenadas con una semilla de evaluación; las demostraciones de navegador son independientes. Los modelos y la vista previa están disponibles mediante acceso para investigación. Consulte la [ficha completa del modelo](https://huggingface.co/gai-labs/samsara-vla/blob/main/MODEL_CARD.md) para conocer métodos y limitaciones, o la página de investigación para ver resultados por suite y comparaciones con modelos publicados. [DETALLES DEL MODELO ## Samsara-VLA Control robótico con memoria recurrente: 217M parámetros y 94.50% de éxito en LIBERO nativo. ↗](https://www.goodailabs.com/es/research/samsara-vla/) [Más información del laboratorio ↗](https://www.goodailabs.com/es/blog/)