[Investigación](https://www.goodailabs.com/es/research/) Experimental # Samsara-VLA Control robótico con memoria. Dos políticas robóticas compactas para manipulación guiada por lenguaje. Vea cómo recogen, colocan, abren y completan tareas de varios pasos. [Ver los resultados ↓](https://www.goodailabs.com/#native-libero-results)[Lea el anuncio ↗](https://www.goodailabs.com/es/blog/samsara-capability-and-compute/) Samsara-VLA / En acción ## De la instrucción a la tarea completada Samsara-VLA arriba. Samsara-VLA Tiny abajo. Todas las categorías a la vista. ### Espacial Encontrar el objeto descrito por su posición. Samsara-VLA Cámara de escenaCámara de muñeca [Ver Samsara-VLA · Espacial (MP4)](https://www.goodailabs.com/media/samsara/release/base/spatial.mp4). “Recoge el bol negro entre el plato y el ramequín y colócalo en el plato” ✓ Tarea completada5.9 S Samsara-VLA Tiny Cámara de escenaCámara de muñeca [Ver Samsara-VLA Tiny · Espacial (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/spatial.mp4). “Recoge el bol negro entre el plato y el ramequín y colócalo en el plato” ✓ Tarea completada5.55 S ### Objetos Seleccionar el objeto indicado entre otros objetos. Samsara-VLA Cámara de escenaCámara de muñeca [Ver Samsara-VLA · Objetos (MP4)](https://www.goodailabs.com/media/samsara/release/base/object.mp4). “Recoge el queso crema y colócalo en la cesta” ✓ Tarea completada8.2 S Samsara-VLA Tiny Cámara de escenaCámara de muñeca [Ver Samsara-VLA Tiny · Objetos (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/object.mp4). “Recoge el queso crema y colócalo en la cesta” ✓ Tarea completada8.45 S ### Objetivos Modificar la escena según la instrucción. Samsara-VLA Cámara de escenaCámara de muñeca [Ver Samsara-VLA · Objetivo (MP4)](https://www.goodailabs.com/media/samsara/release/base/goal.mp4). “Abre el cajón central del armario” ✓ Tarea completada7.8 S Samsara-VLA Tiny Cámara de escenaCámara de muñeca [Ver Samsara-VLA Tiny · Objetivo (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/goal.mp4). “Abre el cajón central del armario” ✓ Tarea completada8.7 S ### Secuencias Ejecutar una instrucción con varias acciones. Samsara-VLA Cámara de escenaCámara de muñeca [Ver Samsara-VLA · Secuencias largas (MP4)](https://www.goodailabs.com/media/samsara/release/base/long.mp4). “Pon la sopa de letras y la caja de queso crema en la cesta” ✓ Tarea completada13.8 S Samsara-VLA Tiny Cámara de escenaCámara de muñeca [Ver Samsara-VLA Tiny · Secuencias largas (MP4)](https://www.goodailabs.com/media/samsara/release/tiny/long.mp4). “Pon la sopa de letras y la caja de queso crema en la cesta” ✓ Tarea completada13.9 S Dos modelos. Cuatro tipos de manipulación. Episodios exitosos seleccionados de ambos checkpoints publicados. Se muestran juntas las cámaras de escena y muñeca. Acciones completas registradas y reproducidas en el simulador original. La reproducción sigue el tiempo de simulación y excluye las esperas de inferencia. Las tasas de éxito proceden de la evaluación completa. ## Dos modelos, una interfaz Samsara-VLA convierte imágenes de cámara, una instrucción en inglés y el estado del robot en control continuo. Mantiene una memoria compacta entre observaciones y predice doce acciones a la vez. Samsara-VLA Tiny utiliza la misma interfaz con un codificador visual más pequeño. Modelo completo ### Samsara-VLA Éxito nativo en LIBERO 94.50% Parámetros 217.43M 1,890 / 2,000 episodios exitosos Modelo compacto ### Samsara-VLA Tiny Éxito nativo en LIBERO 89.30% Parámetros 136.52M 1,786 / 2,000 episodios exitosos Tiny utiliza un 37.2% menos de parámetros, con 5.2 puntos de diferencia en el éxito global. Ambos recuentos incluyen el codificador de texto congelado. Los dos modelos se entrenaron durante 40,000 actualizaciones y 5.12 millones de presentaciones de muestras supervisadas. ## Resultados de LIBERO nativo Evaluamos cada checkpoint publicado en 40 tareas y 2,000 episodios. Cada tarea utiliza cincuenta estados iniciales oficiales. La selección de objetos es la suite más fuerte de ambos modelos; las secuencias largas muestran la mayor diferencia. Samsara-VLASamsara-VLA Tiny ### Espacial Samsara-VLA 94.2% 471 / 500 Samsara-VLA Tiny 89.8% 449 / 500 ### Objetos Samsara-VLA 99.4% 497 / 500 Samsara-VLA Tiny 98.2% 491 / 500 ### Objetivos Samsara-VLA 94.6% 473 / 500 Samsara-VLA Tiny 93.2% 466 / 500 ### Secuencias Samsara-VLA 89.8% 449 / 500 Samsara-VLA Tiny 76.0% 380 / 500 Tasa de éxito por suite. Cada barra va de 0 a 100%; los recuentos indican episodios completados en 500 ensayos. El modelo completo resuelve 449 de 500 episodios Long; Tiny resuelve 380. En Object, completan 497 y 491, respectivamente. Estos recuentos explican mejor el equilibrio entre tamaño y capacidad que una única puntuación global. Esta es una evaluación de simulación realizada por nosotros, con una sola semilla y plantillas de tareas usadas en entrenamiento; no es una prueba independiente con datos reservados. No se ha validado en robots físicos ni en tareas no vistas. ## Tamaño y capacidad Una política compacta facilita explorar el despliegue local. La tabla sitúa nuestros dos modelos junto a resultados publicados de LIBERO e indica el tamaño en cada fila. No establece una clasificación de latencia ni de uso de memoria. Tamaño y éxito en LIBERO modelo | Parámetros | Éxito global | Samsara-VLAUna política · 50 ensayos por tarea · nuestra evaluación | 217.43M | 94.50% | Samsara-VLA TinyUna política · 50 ensayos por tarea · nuestra evaluación | 136.52M | 89.30% | [OpenVLA-OFT · unified ↗](https://arxiv.org/html/2502.19645v2)2 vistas + estado · una política · publicado | Base de 7B | 96.8% | [π₀ ↗](https://arxiv.org/html/2502.19645v2#S5.T1)2 visitas + estado · publicado | 3.3B | 94.2% | [SmolVLA · 450M ↗](https://arxiv.org/html/2506.01844v1)Tarea múltiple · 10 pruebas/tarea · replanificar cada acción | 450M | 87.3% | [OpenVLA ↗](https://arxiv.org/html/2406.09246v3#A5.T12)1 vista · publicado | 7B | 76.5% | Referencias publicadas, no reevaluaciones en condiciones idénticas. Difieren las entradas de cámara, los datos de entrenamiento, el uso compartido de políticas y los ensayos. Samsara incluye los componentes congelados en el recuento de parámetros; los tamaños de referencia siguen los artículos citados. ## Cómo actúa la política La instrucción indica qué hacer; las cámaras muestran la escena actual. La memoria lleva el contexto a la siguiente decisión. Las nuevas características visuales y el historial determinan conjuntamente la siguiente secuencia de acciones. Samsara-VLA / Observar, recordar, actuar ### Visión actual, historia persistente. - 01 / Observar #### Lea la escena desde dos puntos de vista. La cámara de escena localiza el armario. La cámara de muñeca muestra la vista desde la pinza. Tanto las imágenes de 256 × 256 como la instrucción ingresan a la política en cada replanificación. «Abre el cajón central del armario». Cámara de escenaCámara de muñeca Vistas de escena y muñeca al inicio de la tarea grabada del cajón. Vistas de cámara + instrucción + estado del robot ↻ Observar de nuevo. Mantener el historial hasta que termine el episodio. Vistas de escena y muñeca del mismo episodio grabado. - 02 / Recordar #### Actualiza el historial sin perder detalles espaciales. Dos bloques recurrentes resumen las observaciones anteriores y el estado del robot. Un token de historial llega al decodificador de acciones junto con las características de la imagen actual, que conservan su detalle espacial. «Abre el cajón central del armario». Observaciones anteriores → Estado recurrente compacto ↓ Vistas actuales de cámara + memoria Contexto para la siguiente decisión ↻ Observar de nuevo. Mantener el historial hasta que termine el episodio. Esquema del contexto retenido, no una visualización de los valores de memoria aprendidos. - 03 / Actuar #### Predice una secuencia corta de acciones. El decodificador predice doce acciones, cada una con siete valores de control para la posición, la rotación y la pinza. El controlador ejecuta el fragmento antes de solicitar otro a la política. «Abre el cajón central del armario». Una predicción / Doce acciones 01 02 03 04 05 06 07 08 09 10 11 12 PosiciónRotaciónPinza Esquema de la estructura de acciones. Cada columna es un paso de control. ↻ Observar de nuevo. Mantener el historial hasta que termine el episodio. Doce acciones, cada una con siete valores de control. El diagrama muestra la estructura de salida. - 04 / Repetir #### Observar de nuevo, conservando el historial. Las nuevas imágenes de cámara actualizan la vista actual. La caché del historial mantiene la misma forma a medida que el episodio crece y se restablece en el siguiente episodio. Su efecto sobre el éxito aún necesita una ablación equivalente. «Abre el cajón central del armario». Cámara de escenaCámara de muñeca Vistas de escena y muñeca tras completar la tarea del cajón. Nuevas observaciones + historial retenido ↻ Observar de nuevo. Mantener el historial hasta que termine el episodio. La tarea del cajón se completa en este ejemplo grabado. La política reinicia su historial para el siguiente episodio. Las imágenes proceden del episodio del cajón del modelo publicado. Los diagramas de memoria y acciones explican la interfaz; no miden un beneficio causal de la memoria. ## Se ejecuta en tu dispositivo La misma política puede ejecutarse con el SDK de Python en CPU o CUDA, o mediante ONNX en un navegador. El navegador utiliza WebGPU cuando está disponible y WebAssembly CPU en caso contrario. Tras cargar el modelo, la inferencia se ejecuta localmente, sin un servicio de predicción. La vista previa del navegador es una demostración separada del benchmark nativo. En pruebas de CPU con escenas fijas, el modelo completo resolvió las tareas del cuenco y del cajón; Tiny resolvió la del cuenco y agotó el tiempo en la del cajón. Estas pruebas no miden tasas de éxito ni latencia en el navegador. Los modelos y la vista previa del navegador requieren actualmente acceso para investigación. Los pesos derivados de EUPE conservan la licencia FAIR Noncommercial Research License. La [ficha completa del modelo](https://huggingface.co/gai-labs/samsara-vla/blob/main/MODEL_CARD.md) cubre el protocolo, la arquitectura y los requisitos de despliegue. Acceso para investigación ## Investigue con Samsara. Contáctenos para acceder a los modelos, la vista previa del navegador o colaborar en investigación. [research@goodailabs.com](mailto:research@goodailabs.com?subject=Samsara-VLA+research+access)