Aprendizaje robótico
Cuatro pruebas para la colocación de un robot
Una colocación puede llegar a la meta y caer después. Cuatro protocolos históricos de Samsara probados cuando el éxito debería contar.
Un robot puede colocar un objeto en la portería y derribarlo en su siguiente movimiento. Si el evaluador se detiene ante el primer éxito, tanto una colocación estable como un contacto breve cuentan como aprobados.
Nuestros experimentos anteriores con el Samsara utilizaban cuatro reglas de parada. La primera consideró el éxito tan pronto como el entorno informó del estado objetivo. La segunda exigía que persistiera mientras la política siguiera actuando. El tercero detuvo entonces el control y esperó veinte pasos. El cuarto agregó perturbaciones en el actuador durante la implementación, al tiempo que mantuvo los requisitos de mantenimiento y no intervención.
Cada resultado abarcó 100 episodios por suite, 400 en total, con la semilla aleatoria 1701 y los estados iniciales 10–19. El 96.50% con el criterio del primer éxito usó v9; el 93.75% bajo control sostenido usó v10. Los resultados sin intervención y con perturbaciones, 92.25% y 90.25%, usaron v12. Al cambiar los checkpoints, no podemos atribuir las diferencias únicamente a las reglas de evaluación.
El índice de referencia actual utiliza una regla diferente
La evaluación actual de Samsara utiliza una arquitectura de 217M de parámetros y 2,000 episodios. Su implementación de evaluación fija se detiene en la primera finalización exitosa del entorno. La puntuación global del 94.85% y la puntuación del objeto del 99.6% utilizan esa regla.
Una comparación controlada de las cuatro reglas anteriores mantendría la política fija y reproduciría las mismas condiciones. Hasta entonces, los resultados históricos y el índice de referencia actual responden a diferentes preguntas sobre la manipulación.