FR
Contact
Menu
Publications

ANNONCE

Apprentissage robotique

Présentation de Samsara-VLA

Le contrôle robotique avec mémoire, en deux modèles compacts.

Good AI Labs 2 min de lecture

Samsara-VLA / En action
Deux modèles. Quatre types de manipulation. Épisodes réussis sélectionnés pour les deux checkpoints publiés. Les caméras de scène et de poignet sont affichées ensemble. Actions enregistrées intégralement et rejouées dans le simulateur d’origine. La lecture suit le temps de simulation et exclut les attentes d’inférence. Les taux de réussite proviennent de l’évaluation complète.

Samsara-VLA est une politique robotique qui conserve le contexte d’une observation à la suivante. Elle utilise deux vues caméra et une instruction pour saisir, placer, ouvrir et enchaîner des actions. Les vidéos ci-dessus montrent des épisodes réussis dans leur intégralité pour les deux modèles publiés.

Deux tailles. Une interface de politique.

Samsara-VLA, avec 217M paramètres, a réussi 1,890 des 2,000 épisodes natifs de LIBERO. Samsara-VLA Tiny utilise 136M paramètres et en a réussi 1,786 avec le même protocole d’évaluation.

Modèle complet

Samsara-VLA

Réussite native sur LIBERO
94.50%
Paramètres
217.43M

1,890 / 2,000 épisodes réussis

Modèle compact

Samsara-VLA Tiny

Réussite native sur LIBERO
89.30%
Paramètres
136.52M

1,786 / 2,000 épisodes réussis

L’écart est le plus net sur les tâches longues : 89.8% de réussite pour le modèle complet et 76.0% pour Tiny. La sélection d’objets reste solide pour les deux, à 99.4% et 98.2%. Tiny réduit le nombre de paramètres de 37.2%.

Le contexte entre les actions

Chaque décision associe une nouvelle vue de la scène à une mémoire compacte des observations précédentes. La politique prédit douze actions de contrôle, les exécute, puis observe à nouveau. Sa mémoire est réinitialisée au début d’une nouvelle tâche.

Une politique à exécuter localement

Les deux modèles partagent un SDK Python pour CPU et CUDA, avec des exports ONNX pour l’inférence dans le navigateur. Après chargement du modèle, l’aperçu s’exécute sur votre appareil avec WebGPU ou WebAssembly CPU.

Ce sont des politiques expérimentales de simulation. Les résultats natifs couvrent quarante modèles de tâches d’entraînement avec une graine d’évaluation ; les démonstrations dans le navigateur sont distinctes. Les modèles et l’aperçu sont accessibles sur demande pour la recherche. La fiche complète du modèle détaille méthodes et limites ; la page de recherche présente les résultats par suite et les comparaisons avec les modèles publiés.

DÉTAILS DU MODÈLE

Samsara-VLA

Contrôle robotique avec mémoire récurrente : 217M paramètres et 94.50% de réussite sur LIBERO natif.