[↖ Publicações](https://www.goodailabs.com/pt/blog/) Avaliação # Selecionando o checkpoint do Samsara O checkpoint de 80,000 etapas selecionado terminou dois episódios à frente do candidato de 34,000 etapas. Todos os cinco resultados da mesma avaliação de 2,000 episódios. Good AI Labs 3 de outubro de 2026 2 min de leitura NESTE ARTIGO - [A seleção muda a pergunta](https://www.goodailabs.com/#selection-changes-the-question) [Todas as publicações ↗](https://www.goodailabs.com/pt/blog/) O checkpoint do Samsara selecionado aos 80,000 passos concluiu 1,897 episódios de LIBERO. O checkpoint de 34,000 passos concluiu 1,895. A diferença foi de apenas dois sucessos em 2,000 tentativas. Avaliamos cinco candidatos nas mesmas quarenta tarefas e cinquenta estados iniciais por tarefa e, em seguida, selecionamos a pontuação mais alta. Atualizações de treinamento | Episódios de sucesso | Taxa de sucesso | 20,000 | 1,862 / 2,000 | 93.10% | 34,000 | 1,895 / 2,000 | 94.75% | 40,000 | 1,878 / 2,000 | 93.90% | 60,000 | 1,889 / 2,000 | 94.45% | 80,000 | 1,897 / 2,000 | 94.85% | As pontuações não melhoraram constantemente com o treinamento. Uma vantagem de 0.10 ponto sobre o candidato de 34,000 etapas é muito pequena para que essa corrida única estabeleça uma melhoria confiável. O relatório [Samsara](https://www.goodailabs.com/pt/research/samsara-vla/) inclui o detalhamento da suíte e a configuração do treinamento. Comparar as mesmas tarefas e estados iniciais revela mais que os totais. O modelo selecionado teve sucesso em 68 estados nos quais o de 34,000 passos falhou; o anterior teve sucesso em 66 nos quais o selecionado falhou. A vantagem de dois episódios inclui 134 resultados diferentes. ## A seleção muda a pergunta Esses episódios ajudaram a escolher o modelo, então a pontuação de 94.85% é um resultado do desenvolvimento . A confirmação fixaria o checkpoint e o procedimento de avaliação antes de usar exemplos reservados e, em seguida, repetiria com sementes adicionais. O mesmo problema se aplica aos diagnósticos do reflex-1. Suas pontuações de 95.0% em Banking77 e 92.2% em Emotion vieram de 500 exemplos de subconjuntos inspecionados durante o desenvolvimento, em famílias de tarefas incluídas no treinamento. Esses resultados descrevem o desempenho de tarefas familiares. As perguntas de um novo aplicativo precisam de sua própria avaliação. ∎[Voltar ao diário ↗](https://www.goodailabs.com/pt/blog/) Continuar lendo [Sistemas de agentesApresentando Colony: agentes pessoais com memória e ferramentas↗](https://www.goodailabs.com/pt/blog/colony-runtime-and-model-budget/) [Memória espacialApresentando re1: memória espacial para IA física↗](https://www.goodailabs.com/pt/blog/re1-video-memory/)