Aprendizado robótico
Quatro testes para a colocação de um robô
Uma colocação pode atingir a meta e cair depois. Quatro protocolos históricos do Samsara foram testados quando o sucesso deveria contar.
Um robô pode colocar um objeto no gol e derrubá-lo na próxima jogada. Se o avaliador parar no primeiro sucesso, tanto uma colocação estável quanto um breve contato contam como aprovações.
Nossos experimentos anteriores com o Samsara usaram quatro regras de parada. O primeiro teve sucesso assim que o ambiente relatou o estado da meta. A segunda exigia que ela persistisse enquanto a política continuava atuando. O terceiro então parou de controlar e esperou vinte passos. O quarto aumentou a perturbação do atuador durante a implantação, mantendo os requisitos contínuos e de ausência de intervenção.
Cada resultado abrangeu 100 episódios por suíte, 400 no total, com semente aleatória 1701 e estados iniciais 10–19. O resultado de 96.50% pelo critério do primeiro sucesso usou v9; os 93.75% sob controle sustentado usaram v10. Os resultados sem intervenção e com perturbações, 92.25% e 90.25%, usaram v12. Como os checkpoints mudaram, não podemos atribuir as diferenças apenas às regras de avaliação.
O benchmark atual usa uma regra diferente.
A avaliação atual do Samsara usa uma arquitetura de 217M de parâmetros e 2,000 episódios. Sua implementação de avaliação fixa é interrompida no primeiro encerramento bem-sucedido do ambiente. A pontuação geral de 94.85% e a pontuação do objeto de 99.6% usam essa regra.
Uma comparação controlada das quatro regras anteriores manteria a política fixa e repetiria as mesmas condições. Até lá, os resultados históricos e o benchmark atual respondem a diferentes questões sobre manipulação.