Apprentissage robotique
Présentation de Samsara-VLA
Le contrôle robotique avec mémoire, en deux modèles compacts.
De la consigne à la tâche accomplie
Samsara-VLA en haut. Samsara-VLA Tiny en bas. Toutes les catégories restent visibles.
Spatial
Trouver l’objet décrit par sa position.
Samsara-VLA
“Prendre le bol noir entre l’assiette et le ramequin et le poser sur l’assiette”
Samsara-VLA Tiny
“Prendre le bol noir entre l’assiette et le ramequin et le poser sur l’assiette”
Objets
Sélectionner l’objet nommé parmi d’autres objets.
Samsara-VLA
“Prendre le fromage à tartiner et le mettre dans le panier”
Samsara-VLA Tiny
“Prendre le fromage à tartiner et le mettre dans le panier”
Objectifs
Modifier la scène selon la consigne.
Samsara-VLA
“Ouvrir le tiroir central du meuble”
Samsara-VLA Tiny
“Ouvrir le tiroir central du meuble”
Séquences
Exécuter une consigne en plusieurs actions.
Samsara-VLA
“Mettre la soupe alphabet et la boîte de fromage à tartiner dans le panier”
Samsara-VLA Tiny
“Mettre la soupe alphabet et la boîte de fromage à tartiner dans le panier”
Samsara-VLA est une politique robotique qui conserve le contexte d’une observation à la suivante. Elle utilise deux vues caméra et une instruction pour saisir, placer, ouvrir et enchaîner des actions. Les vidéos ci-dessus montrent des épisodes réussis dans leur intégralité pour les deux modèles publiés.
Deux tailles. Une interface de politique.
Samsara-VLA, avec 217M paramètres, a réussi 1,890 des 2,000 épisodes natifs de LIBERO. Samsara-VLA Tiny utilise 136M paramètres et en a réussi 1,786 avec le même protocole d’évaluation.
Modèle complet
Samsara-VLA
- Réussite native sur LIBERO
- 94.50%
- Paramètres
- 217.43M
1,890 / 2,000 épisodes réussis
Modèle compact
Samsara-VLA Tiny
- Réussite native sur LIBERO
- 89.30%
- Paramètres
- 136.52M
1,786 / 2,000 épisodes réussis
L’écart est le plus net sur les tâches longues : 89.8% de réussite pour le modèle complet et 76.0% pour Tiny. La sélection d’objets reste solide pour les deux, à 99.4% et 98.2%. Tiny réduit le nombre de paramètres de 37.2%.
Le contexte entre les actions
Chaque décision associe une nouvelle vue de la scène à une mémoire compacte des observations précédentes. La politique prédit douze actions de contrôle, les exécute, puis observe à nouveau. Sa mémoire est réinitialisée au début d’une nouvelle tâche.
Une politique à exécuter localement
Les deux modèles partagent un SDK Python pour CPU et CUDA, avec des exports ONNX pour l’inférence dans le navigateur. Après chargement du modèle, l’aperçu s’exécute sur votre appareil avec WebGPU ou WebAssembly CPU.
Ce sont des politiques expérimentales de simulation. Les résultats natifs couvrent quarante modèles de tâches d’entraînement avec une graine d’évaluation ; les démonstrations dans le navigateur sont distinctes. Les modèles et l’aperçu sont accessibles sur demande pour la recherche. La fiche complète du modèle détaille méthodes et limites ; la page de recherche présente les résultats par suite et les comparaisons avec les modèles publiés.
DÉTAILS DU MODÈLE
Samsara-VLA
Contrôle robotique avec mémoire récurrente : 217M paramètres et 94.50% de réussite sur LIBERO natif.