PT
Contato
Menu
Publicações

Avaliação

Selecionando o checkpoint do Samsara

O checkpoint de 80,000 etapas selecionado terminou dois episódios à frente do candidato de 34,000 etapas. Todos os cinco resultados da mesma avaliação de 2,000 episódios.

O checkpoint do Samsara selecionado aos 80,000 passos concluiu 1,897 episódios de LIBERO. O checkpoint de 34,000 passos concluiu 1,895. A diferença foi de apenas dois sucessos em 2,000 tentativas.

Avaliamos cinco candidatos nas mesmas quarenta tarefas e cinquenta estados iniciais por tarefa e, em seguida, selecionamos a pontuação mais alta.

Atualizações de treinamentoEpisódios de sucessoTaxa de sucesso
20,0001,862 / 2,00093.10%
34,0001,895 / 2,00094.75%
40,0001,878 / 2,00093.90%
60,0001,889 / 2,00094.45%
80,0001,897 / 2,00094.85%

As pontuações não melhoraram constantemente com o treinamento. Uma vantagem de 0.10 ponto sobre o candidato de 34,000 etapas é muito pequena para que essa corrida única estabeleça uma melhoria confiável. O relatório Samsara inclui o detalhamento da suíte e a configuração do treinamento.

Comparar as mesmas tarefas e estados iniciais revela mais que os totais. O modelo selecionado teve sucesso em 68 estados nos quais o de 34,000 passos falhou; o anterior teve sucesso em 66 nos quais o selecionado falhou. A vantagem de dois episódios inclui 134 resultados diferentes.

A seleção muda a pergunta

Esses episódios ajudaram a escolher o modelo, então a pontuação de 94.85% é um resultado do desenvolvimento . A confirmação fixaria o checkpoint e o procedimento de avaliação antes de usar exemplos reservados e, em seguida, repetiria com sementes adicionais.

O mesmo problema se aplica aos diagnósticos do reflex-1. Suas pontuações de 95.0% em Banking77 e 92.2% em Emotion vieram de 500 exemplos de subconjuntos inspecionados durante o desenvolvimento, em famílias de tarefas incluídas no treinamento. Esses resultados descrevem o desempenho de tarefas familiares. As perguntas de um novo aplicativo precisam de sua própria avaliação.