ES
Contacto
Menú

Investigación Experimental

Samsara-VLA

Control robótico con memoria.

Dos políticas robóticas compactas para manipulación guiada por lenguaje. Vea cómo recogen, colocan, abren y completan tareas de varios pasos.

Samsara-VLA / En acción
Dos modelos. Cuatro tipos de manipulación. Episodios exitosos seleccionados de ambos checkpoints publicados. Se muestran juntas las cámaras de escena y muñeca. Acciones completas registradas y reproducidas en el simulador original. La reproducción sigue el tiempo de simulación y excluye las esperas de inferencia. Las tasas de éxito proceden de la evaluación completa.

Dos modelos, una interfaz

Samsara-VLA convierte imágenes de cámara, una instrucción en inglés y el estado del robot en control continuo. Mantiene una memoria compacta entre observaciones y predice doce acciones a la vez. Samsara-VLA Tiny utiliza la misma interfaz con un codificador visual más pequeño.

Modelo completo

Samsara-VLA

Éxito nativo en LIBERO
94.50%
Parámetros
217.43M

1,890 / 2,000 episodios exitosos

Modelo compacto

Samsara-VLA Tiny

Éxito nativo en LIBERO
89.30%
Parámetros
136.52M

1,786 / 2,000 episodios exitosos

Tiny utiliza un 37.2% menos de parámetros, con 5.2 puntos de diferencia en el éxito global. Ambos recuentos incluyen el codificador de texto congelado. Los dos modelos se entrenaron durante 40,000 actualizaciones y 5.12 millones de presentaciones de muestras supervisadas.

Resultados de LIBERO nativo

Evaluamos cada checkpoint publicado en 40 tareas y 2,000 episodios. Cada tarea utiliza cincuenta estados iniciales oficiales. La selección de objetos es la suite más fuerte de ambos modelos; las secuencias largas muestran la mayor diferencia.

Samsara-VLASamsara-VLA Tiny

Espacial

Samsara-VLA 94.2%471 / 500
Samsara-VLA Tiny 89.8%449 / 500

Objetos

Samsara-VLA 99.4%497 / 500
Samsara-VLA Tiny 98.2%491 / 500

Objetivos

Samsara-VLA 94.6%473 / 500
Samsara-VLA Tiny 93.2%466 / 500

Secuencias

Samsara-VLA 89.8%449 / 500
Samsara-VLA Tiny 76.0%380 / 500
Tasa de éxito por suite. Cada barra va de 0 a 100%; los recuentos indican episodios completados en 500 ensayos.

El modelo completo resuelve 449 de 500 episodios Long; Tiny resuelve 380. En Object, completan 497 y 491, respectivamente. Estos recuentos explican mejor el equilibrio entre tamaño y capacidad que una única puntuación global.

Esta es una evaluación de simulación realizada por nosotros, con una sola semilla y plantillas de tareas usadas en entrenamiento; no es una prueba independiente con datos reservados. No se ha validado en robots físicos ni en tareas no vistas.

Tamaño y capacidad

Una política compacta facilita explorar el despliegue local. La tabla sitúa nuestros dos modelos junto a resultados publicados de LIBERO e indica el tamaño en cada fila. No establece una clasificación de latencia ni de uso de memoria.

Tamaño y éxito en LIBERO
modeloParámetrosÉxito global
Samsara-VLAUna política · 50 ensayos por tarea · nuestra evaluación217.43M94.50%
Samsara-VLA TinyUna política · 50 ensayos por tarea · nuestra evaluación136.52M89.30%
OpenVLA-OFT · unified 2 vistas + estado · una política · publicadoBase de 7B96.8%
π₀ 2 visitas + estado · publicado3.3B94.2%
SmolVLA · 450M Tarea múltiple · 10 pruebas/tarea · replanificar cada acción450M87.3%
OpenVLA 1 vista · publicado7B76.5%

Referencias publicadas, no reevaluaciones en condiciones idénticas. Difieren las entradas de cámara, los datos de entrenamiento, el uso compartido de políticas y los ensayos. Samsara incluye los componentes congelados en el recuento de parámetros; los tamaños de referencia siguen los artículos citados.

Cómo actúa la política

La instrucción indica qué hacer; las cámaras muestran la escena actual. La memoria lleva el contexto a la siguiente decisión. Las nuevas características visuales y el historial determinan conjuntamente la siguiente secuencia de acciones.

Samsara-VLA / Observar, recordar, actuar

Visión actual, historia persistente.

  1. 01 / Observar

    Lea la escena desde dos puntos de vista.

    La cámara de escena localiza el armario. La cámara de muñeca muestra la vista desde la pinza. Tanto las imágenes de 256 × 256 como la instrucción ingresan a la política en cada replanificación.

    «Abre el cajón central del armario».

    Cámara de escenaCámara de muñeca
    Vistas de escena y muñeca al inicio de la tarea grabada del cajón.
    Vistas de cámara + instrucción + estado del robot

    ↻ Observar de nuevo. Mantener el historial hasta que termine el episodio.

    Vistas de escena y muñeca del mismo episodio grabado.
  2. 02 / Recordar

    Actualiza el historial sin perder detalles espaciales.

    Dos bloques recurrentes resumen las observaciones anteriores y el estado del robot. Un token de historial llega al decodificador de acciones junto con las características de la imagen actual, que conservan su detalle espacial.

    «Abre el cajón central del armario».

    Observaciones anteriores

    Estado recurrente compacto

    Vistas actuales de cámara + memoria

    Contexto para la siguiente decisión

    ↻ Observar de nuevo. Mantener el historial hasta que termine el episodio.

    Esquema del contexto retenido, no una visualización de los valores de memoria aprendidos.
  3. 03 / Actuar

    Predice una secuencia corta de acciones.

    El decodificador predice doce acciones, cada una con siete valores de control para la posición, la rotación y la pinza. El controlador ejecuta el fragmento antes de solicitar otro a la política.

    «Abre el cajón central del armario».

    Una predicción / Doce acciones

    01
    02
    03
    04
    05
    06
    07
    08
    09
    10
    11
    12
    PosiciónRotaciónPinza

    Esquema de la estructura de acciones. Cada columna es un paso de control.

    ↻ Observar de nuevo. Mantener el historial hasta que termine el episodio.

    Doce acciones, cada una con siete valores de control. El diagrama muestra la estructura de salida.
  4. 04 / Repetir

    Observar de nuevo, conservando el historial.

    Las nuevas imágenes de cámara actualizan la vista actual. La caché del historial mantiene la misma forma a medida que el episodio crece y se restablece en el siguiente episodio. Su efecto sobre el éxito aún necesita una ablación equivalente.

    «Abre el cajón central del armario».

    Cámara de escenaCámara de muñeca
    Vistas de escena y muñeca tras completar la tarea del cajón.
    Nuevas observaciones + historial retenido

    ↻ Observar de nuevo. Mantener el historial hasta que termine el episodio.

    La tarea del cajón se completa en este ejemplo grabado. La política reinicia su historial para el siguiente episodio.

Las imágenes proceden del episodio del cajón del modelo publicado. Los diagramas de memoria y acciones explican la interfaz; no miden un beneficio causal de la memoria.

Se ejecuta en tu dispositivo

La misma política puede ejecutarse con el SDK de Python en CPU o CUDA, o mediante ONNX en un navegador. El navegador utiliza WebGPU cuando está disponible y WebAssembly CPU en caso contrario. Tras cargar el modelo, la inferencia se ejecuta localmente, sin un servicio de predicción.

La vista previa del navegador es una demostración separada del benchmark nativo. En pruebas de CPU con escenas fijas, el modelo completo resolvió las tareas del cuenco y del cajón; Tiny resolvió la del cuenco y agotó el tiempo en la del cajón. Estas pruebas no miden tasas de éxito ni latencia en el navegador.

Los modelos y la vista previa del navegador requieren actualmente acceso para investigación. Los pesos derivados de EUPE conservan la licencia FAIR Noncommercial Research License. La ficha completa del modelo cubre el protocolo, la arquitectura y los requisitos de despliegue.

Acceso para investigación

Investigue con Samsara.

Contáctenos para acceder a los modelos, la vista previa del navegador o colaborar en investigación.

research@goodailabs.com