[↖ Publicações](https://www.goodailabs.com/pt/blog/) Aprendizado robótico # Quatro testes para a colocação de um robô Uma colocação pode atingir a meta e cair depois. Quatro protocolos históricos do Samsara foram testados quando o sucesso deveria contar. Good AI Labs 2 de outubro de 2026 2 min de leitura NESTE ARTIGO - [O benchmark atual usa uma regra diferente](https://www.goodailabs.com/#the-current-benchmark-uses-a-different-rule) [Todas as publicações ↗](https://www.goodailabs.com/pt/blog/) Um robô pode colocar um objeto no gol e derrubá-lo na próxima jogada. Se o avaliador parar no primeiro sucesso, tanto uma colocação estável quanto um breve contato contam como aprovações. Nossos experimentos anteriores com o Samsara usaram quatro regras de parada. O primeiro teve sucesso assim que o ambiente relatou o estado da meta. A segunda exigia que ela persistisse enquanto a política continuava atuando. O terceiro então parou de controlar e esperou vinte passos. O quarto aumentou a perturbação do atuador durante a implantação, mantendo os requisitos contínuos e de ausência de intervenção. Primeiro contatoCHECKPOINT V9 · 400 EPISÓDIOS 96.50 por cento Controle sustentadoCHECKPOINT V10 · 400 EPISÓDIOS 93.75 por cento Além disso, 20 etapas sem intervençãoCHECKPOINT V12 · 400 EPISÓDIOS 92.25 por cento Com perturbação do atuadorCHECKPOINT V12 · 400 EPISÓDIOS 90.25 por cento 0%TAXA DE SUCESSO/100% Resultados históricos do desenvolvimento. Cada protocolo abrangeu 400 episódios, mas o checkpoint também mudou. Cada resultado abrangeu 100 episódios por suíte, 400 no total, com semente aleatória 1701 e estados iniciais 10–19. O resultado de 96.50% pelo critério do primeiro sucesso usou v9; os 93.75% sob controle sustentado usaram v10. Os resultados sem intervenção e com perturbações, 92.25% e 90.25%, usaram v12. Como os checkpoints mudaram, não podemos atribuir as diferenças apenas às regras de avaliação. ## O benchmark atual usa uma regra diferente. A avaliação [atual do Samsara](https://www.goodailabs.com/pt/research/samsara-vla/) usa uma arquitetura de 217M de parâmetros e 2,000 episódios. Sua implementação de avaliação fixa é interrompida no primeiro encerramento bem-sucedido do ambiente. A pontuação geral de 94.85% e a pontuação do objeto de 99.6% usam essa regra. Uma comparação controlada das quatro regras anteriores manteria a política fixa e repetiria as mesmas condições. Até lá, os resultados históricos e o benchmark atual respondem a diferentes questões sobre manipulação. ∎[Voltar ao diário ↗](https://www.goodailabs.com/pt/blog/) Continuar lendo [O laboratórioPor que criamos modelos locais↗](https://www.goodailabs.com/pt/blog/goodness-first/) [SistemasEscolhendo hardware para um modelo local↗](https://www.goodailabs.com/pt/blog/sovereign-intelligence/)