Apprentissage robotique
Quatre tests pour le placement d'un robot
Un placement peut atteindre l'objectif et échouer par la suite. Quatre protocoles Samsara historiques ont été testés lorsque le succès devait compter.
Un robot peut placer un objet sur le but et le faire tomber lors de son prochain mouvement. Si l'évaluateur s'arrête au premier succès, un placement stable et un bref contact sont considérés comme des réussites.
Nos expériences précédentes au Samsara utilisaient quatre règles d'arrêt. Le premier a été considéré comme un succès dès que l'environnement a indiqué l'état de l'objectif. La seconde exigeait qu'elle persiste pendant que la politique continuait d'agir. Le troisième a ensuite arrêté le contrôle et a attendu vingt pas. Le quatrième a ajouté une perturbation de l'actionneur pendant le déploiement, tout en maintenant les exigences de maintien et de non-intervention.
Chaque résultat couvre 100 épisodes par suite, soit 400 au total, avec la graine aléatoire 1701 et les états initiaux 10–19. Le résultat de 96.50% au premier succès utilise v9 ; celui de 93.75% en contrôle soutenu utilise v10. Les résultats sans intervention et sous perturbation, 92.25% et 90.25%, utilisent v12. Les checkpoints étant différents, les écarts ne peuvent pas être attribués aux seules règles d’évaluation.
L'indice de référence actuel utilise une règle différente
L'évaluation actuelle de Samsara utilise une architecture de 217M paramètres et 2,000 épisodes. Son déploiement d'évaluation épinglée s'arrête dès la première fermeture réussie de l'environnement. Le score global de 94.85% et le score d'objet de 99.6% utilisent cette règle.
Une comparaison contrôlée des quatre règles précédentes maintiendrait la politique fixe et reproduirait les mêmes conditions. D'ici là, les résultats historiques et l'indice de référence actuel répondent à différentes questions concernant la manipulation.