PT
Contato
Menu
Publicações

Aprendizado robótico

Quatro testes para a colocação de um robô

Uma colocação pode atingir a meta e cair depois. Quatro protocolos históricos do Samsara foram testados quando o sucesso deveria contar.

Um robô pode colocar um objeto no gol e derrubá-lo na próxima jogada. Se o avaliador parar no primeiro sucesso, tanto uma colocação estável quanto um breve contato contam como aprovações.

Nossos experimentos anteriores com o Samsara usaram quatro regras de parada. O primeiro teve sucesso assim que o ambiente relatou o estado da meta. A segunda exigia que ela persistisse enquanto a política continuava atuando. O terceiro então parou de controlar e esperou vinte passos. O quarto aumentou a perturbação do atuador durante a implantação, mantendo os requisitos contínuos e de ausência de intervenção.

Primeiro contatoCHECKPOINT V9 · 400 EPISÓDIOS
96.50 por cento
Controle sustentadoCHECKPOINT V10 · 400 EPISÓDIOS
93.75 por cento
Além disso, 20 etapas sem intervençãoCHECKPOINT V12 · 400 EPISÓDIOS
92.25 por cento
Com perturbação do atuadorCHECKPOINT V12 · 400 EPISÓDIOS
90.25 por cento
Resultados históricos do desenvolvimento. Cada protocolo abrangeu 400 episódios, mas o checkpoint também mudou.

Cada resultado abrangeu 100 episódios por suíte, 400 no total, com semente aleatória 1701 e estados iniciais 10–19. O resultado de 96.50% pelo critério do primeiro sucesso usou v9; os 93.75% sob controle sustentado usaram v10. Os resultados sem intervenção e com perturbações, 92.25% e 90.25%, usaram v12. Como os checkpoints mudaram, não podemos atribuir as diferenças apenas às regras de avaliação.

O benchmark atual usa uma regra diferente.

A avaliação atual do Samsara usa uma arquitetura de 217M de parâmetros e 2,000 episódios. Sua implementação de avaliação fixa é interrompida no primeiro encerramento bem-sucedido do ambiente. A pontuação geral de 94.85% e a pontuação do objeto de 99.6% usam essa regra.

Uma comparação controlada das quatro regras anteriores manteria a política fixa e repetiria as mesmas condições. Até lá, os resultados históricos e o benchmark atual respondem a diferentes questões sobre manipulação.