FR
Contact
Menu
Publications

Apprentissage robotique

Quatre tests pour le placement d'un robot

Un placement peut atteindre l'objectif et échouer par la suite. Quatre protocoles Samsara historiques ont été testés lorsque le succès devait compter.

Un robot peut placer un objet sur le but et le faire tomber lors de son prochain mouvement. Si l'évaluateur s'arrête au premier succès, un placement stable et un bref contact sont considérés comme des réussites.

Nos expériences précédentes au Samsara utilisaient quatre règles d'arrêt. Le premier a été considéré comme un succès dès que l'environnement a indiqué l'état de l'objectif. La seconde exigeait qu'elle persiste pendant que la politique continuait d'agir. Le troisième a ensuite arrêté le contrôle et a attendu vingt pas. Le quatrième a ajouté une perturbation de l'actionneur pendant le déploiement, tout en maintenant les exigences de maintien et de non-intervention.

Premier contactCHECKPOINT V9 · 400 ÉPISODES
96.50 pour cent
Contrôle soutenuCHECKPOINT V10 · 400 ÉPISODES
93.75 pour cent
Plus 20 étapes sans interventionCHECKPOINT V12 · 400 ÉPISODES
92.25 pour cent
Avec perturbation de l'actionneurCHECKPOINT V12 · 400 ÉPISODES
90.25 pour cent
Résultats historiques en matière de développement. Chaque protocole couvrait 400 épisodes, mais le point de contrôle a également changé.

Chaque résultat couvre 100 épisodes par suite, soit 400 au total, avec la graine aléatoire 1701 et les états initiaux 10–19. Le résultat de 96.50% au premier succès utilise v9 ; celui de 93.75% en contrôle soutenu utilise v10. Les résultats sans intervention et sous perturbation, 92.25% et 90.25%, utilisent v12. Les checkpoints étant différents, les écarts ne peuvent pas être attribués aux seules règles d’évaluation.

L'indice de référence actuel utilise une règle différente

L'évaluation actuelle de Samsara utilise une architecture de 217M paramètres et 2,000 épisodes. Son déploiement d'évaluation épinglée s'arrête dès la première fermeture réussie de l'environnement. Le score global de 94.85% et le score d'objet de 99.6% utilisent cette règle.

Une comparaison contrôlée des quatre règles précédentes maintiendrait la politique fixe et reproduirait les mêmes conditions. D'ici là, les résultats historiques et l'indice de référence actuel répondent à différentes questions concernant la manipulation.