[Pesquisa](https://www.goodailabs.com/pt/research/) Pesos públicos # Reflex-1 Modelos de decisão para agentes Um modelo de decisão de 421M parâmetros para agentes. Uma única passagem, em CPU ou GPU. Pesos ajustados disponíveis no Hugging Face. [Modelo e pesos em Hugging Face ↗](https://huggingface.co/gai-labs/reflex-1) [Explore o modelo ↓](https://www.goodailabs.com/#project-details) [Leia o anúncio ↗](https://www.goodailabs.com/pt/blog/reflex-1-fast-decisions/) ## Visão geral Muitas decisões do agente terminam com uma escolha: qual fila recebe uma solicitação, qual ferramenta se encaixa em uma tarefa ou qual ação vem a seguir. O Reflex-1 pontua as opções que seu aplicativo fornece em um único passe para frente. Ele retorna uma distribuição de probabilidade que o aplicativo pode usar para tomar essa decisão. A pesquisa segue a direção dos modelos de decisão explorada pelo [Jev](https://docs.typesafe.ai/introduction), com arquitetura e procedimento de treinamento supervisionado próprios. Um codificador de contexto com 28 camadas e outro de candidatos com seis camadas alimentam uma camada de pontuação compartilhada. O checkpoint atual atualiza todos os 420,778,370 parâmetros. O download público padrão fornece o checkpoint ajustado mais recente. Sua ficha contém os resultados de avaliação e as medições atuais de CPU. Os estudos e as gravações com data abaixo preservam a identificação de seus checkpoints originais. Modelo de decisão Versão pública · ambiente de execução 1.0.0 Uso Escolha entre as opções fornecidas por um aplicativo: rótulos, rotas ou ações possíveis. Entrada → saída Estado, pergunta e 1—255 opções → uma distribuição de escolha em uma passagem para frente. modelo 421M parâmetros. Um codificador de contexto com 28 camadas, outro de candidatos com 6 camadas e uma camada de pontuação compartilhada. Execute localmente CPU ou GPU · FP32. A reprodução atual em CPU mediu 2.17 GiB de pico de memória do processo com uma ou quatro threads de computação. Avaliação 92.93% em um subconjunto reservado de 495 casos do Banking77; 21/30 episódios nativos do MiniWoB++. Essas famílias de tarefas estão representadas no treinamento. Acesso Pesos públicos, tokenizadores e código de inferência no Apache 2.0. Texto em inglês; tempo de execução 1.0.0. O download padrão fornece o checkpoint ajustado mais recente. Os estudos e as gravações com data abaixo descrevem checkpoints anteriores. A aplicação fornece as opções e controla a execução. [Pesos e inferência ↗](https://huggingface.co/gai-labs/reflex-1)[Resultados da versão ↗](https://www.goodailabs.com/pt/research/reflex-1/#current-results) ## Resultados atuais A versão de 5 de outubro concluiu 21/30 episódios nativos de navegador MiniWoB++ com um controlador fixo. Obteve 92.93% em 495 exemplos de Banking77. São subconjuntos reservados de famílias de tarefas presentes no treinamento, não pontuações de benchmarks completos. Checkpoint de 5 de outubro · subconjuntos reservados de classificação Tarefa | Acertos / avaliados | Acurácia | AG News | 465 / 500 | 93.00% | SST-5 | 299 / 500 | 59.80% | Emotion | 458 / 500 | 91.60% | Banking77 | 460 / 495 | 92.93% | BoolQ | 171 / 202 | 84.65% | MNLI | 436 / 500 | 87.20% | RACE | 287 / 500 | 57.40% | SciQ | 123 / 128 | 96.09% | Em uma CPU Intel Xeon Platinum 8558, a inferência de Banking77 levou 375.2 ms de mediana e 452.1 ms de p95 com quatro threads de computação. O pico de memória do processo foi de 2.17 GiB, incluindo carregamento, aquecimento e inferência. Medições atuais em CPU Intel Xeon Platinum 8558 · FP32 · lote de 1 Uma thread de computação Latência · menor é mais rápidoMediana//p95 - AG News 1209.7 / 1385.0 ms - SST-5 973.6 / 1160.3 ms - Emotion 956.9 / 1165.8 ms - Banking77 1101.7 / 1276.9 ms - BoolQ 1600.8 / 2710.6 ms 01,5003,000 ms Quatro threads de computação Latência · menor é mais rápidoMediana//p95 - AG News 389.5 / 480.4 ms - SST-5 320.6 / 404.2 ms - Emotion 318.8 / 391.0 ms - Banking77 375.2 / 452.1 ms - BoolQ 486.7 / 782.2 ms 01,5003,000 ms 480 chamadas por configuração de threads sobre 120 entradas em dois processos novos. Inclui tokenização e inferência; exclui carregamento e aquecimento. Host compartilhado, ambiente de avaliação e sem cache entre solicitações. A avaliação completa ainda está pendente. BoolQ, RACE e o diagnóstico público JevBench regrediram em relação ao checkpoint anterior; Dino nativo atingiu a meta de 60 segundos em 0/16 tentativas. A latência atual em GPU não foi medida. A [avaliação publicada](https://huggingface.co/gai-labs/reflex-1/blob/84c2cd49d31f73544e1e17539092056e741e7f03/evaluation.json) registra o checkpoint, as condições e as verificações pendentes. ## Como funciona As respostas dos candidatos são fornecidas com cada solicitação. O modelo suporta de 1 a 255 opções por pergunta, dentro de seus limites simbólicos, e várias perguntas podem compartilhar um estado compactado. Um aplicativo de suporte pode fornecer suas próprias filas; um agente pode fornecer descrições das ferramentas disponíveis. Novos tipos de decisão precisam de seus próprios testes de precisão. O modelo pontua as opções fornecidas; o aplicativo constrói argumentos da ferramenta e decide quais ações são permitidas. O texto do estado é limitado a 512 tokens de tokenizador de contexto e pode ser reduzido ainda mais de acordo com o orçamento da solicitação. Cada opção aceita até 512 tokens de tokenizador de opções. Inspecione state_truncated quando o contexto pode ter sido reduzido. Reflex-1/ Modelo de decisão ### De uma pergunta a uma escolha. - 01 / Fornecer #### Defina a decisão. Seu aplicativo fornece o estado, uma pergunta e as opções sobre as quais ela pode agir. Essas opções podem mudar a cada solicitação: filas de suporte, ferramentas disponíveis ou ações permitidas. Estado + pergunta O cliente foi cobrado duas vezes. Qual problema corresponde? Cobrança duplicadaCartão perdidoTaxa desconhecidaRetirada de dinheiro ↓ Contexto + perguntaModernBERT Cada escolhaMiniLM ↓ Cabeça de pontuação compartilhadaProbabilidades de escolha ↓ AplicaçãoPermissão → argumentos → ação Solicitação de suporte ilustrativa. O aplicativo define o conjunto de candidatos. - 02 / Codificar #### Represente o contexto e os candidatos. Um codificador ModernBERT adaptado lê o estado e a pergunta. Um codificador MiniLM congelado representa cada opção fornecida. Várias perguntas podem compartilhar um estado lotado. Estado + pergunta O cliente foi cobrado duas vezes. Qual problema corresponde? Cobrança duplicadaCartão perdidoTaxa desconhecidaRetirada de dinheiro ↓ Contexto + perguntaModernBERT Cada escolhaMiniLM ↓ Cabeça de pontuação compartilhadaProbabilidades de escolha ↓ AplicaçãoPermissão → argumentos → ação Dois codificadores alimentam uma cabeça de pontuação compartilhada. Esse é um esquema da arquitetura de pré-visualização. - 03 / Pontuar #### Marque todas as opções fornecidas em um passe. A cabeça compartilhada combina o contexto e as representações dos candidatos e, em seguida, retorna uma distribuição de probabilidade sobre as opções fornecidas. Novos tipos de decisão ainda precisam de testes de precisão e calibração. Estado + pergunta O cliente foi cobrado duas vezes. Qual problema corresponde? Cobrança duplicadaCartão perdidoTaxa desconhecidaRetirada de dinheiro ↓ Contexto + perguntaModernBERT Cada escolhaMiniLM ↓ Cabeça de pontuação compartilhadaProbabilidades de escolha ↓ AplicaçãoPermissão → argumentos → ação Uma pontuação por candidato fornecido, normalizada para uma distribuição de probabilidade. - 04 / Agir #### Deixe que o aplicativo execute a decisão. O aplicativo decide quais ações são permitidas, constrói quaisquer argumentos da ferramenta e executa a ação selecionada. O Reflex-1 fornece as pontuações; o sistema circundante possui o circuito de controle. Estado + pergunta O cliente foi cobrado duas vezes. Qual problema corresponde? Cobrança duplicadaCartão perdidoTaxa desconhecidaRetirada de dinheiro ↓ Contexto + perguntaModernBERT Cada escolhaMiniLM ↓ Cabeça de pontuação compartilhadaProbabilidades de escolha ↓ AplicaçãoPermissão → argumentos → ação O limite do aplicativo é importante: pontuar uma ferramenta não a executa. Arquitetura da prévia do desenvolvimento público. A solicitação de suporte ilustra o formato de entrada. ## Exemplos Os exemplos e as comparações de qualidade de decisão abaixo usam o snapshot de 3 de outubro. As medições de velocidade e recursos são identificadas separadamente. Cada gravação preserva seu desfecho observado, incluindo falhas. ### Chromium Dino Esta gravação usa o jogo original chrome://dino do Chromium. Reflex-1 recebe a geometria dos obstáculos visíveis e escolhe correr, pular ou abaixar. Eventos nativos de teclado executam essas escolhas enquanto o relógio do jogo continua durante a inferência. O vídeo mostra quadros reais do navegador em velocidade normal. Reflex-1 · Chromium original43.6 s · VÍDEO SILENCIOSO [Ver Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-002-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 no Chromium Dino nativo, com geometria visível estruturada do motor. Versão de 3 de outubro de 2026. A gravação completa de um percurso independente termina em colisão aos 42.309 segundos (pontuação 535); não completa 60 segundos. O navegador continua durante a inferência. Gravação do navegador em velocidade normal; o relógio do jogo continua durante a inferência. As duas tentativas terminaram em colisão após 42.31 segundos e 30.41 segundos; nenhuma atingiu o limite de 60 segundos. A mais longa aparece primeiro. Os percursos aleatórios são independentes, portanto não permitem uma comparação pareada entre modelos. A segunda tentativa completa está preservada abaixo. Assista à segunda tentativa de Dino Reflex-1 · Chromium original31.8 s · VÍDEO SILENCIOSO [Ver Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-003-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 no Chromium Dino nativo, com geometria visível estruturada do motor. Versão de 3 de outubro de 2026. A gravação completa de um percurso independente termina em colisão aos 30.410 segundos (pontuação 351); não completa 60 segundos. O navegador continua durante a inferência. Gravação do navegador em velocidade normal; o relógio do jogo continua durante a inferência. ### ViZDoom O jogo é o cenário Defend the Center do ViZDoom nativo, na dificuldade 5. Reflex-1 escolhe ações a partir dos limites de objetos visíveis, vida e munição. É um controlador de estado estruturado; não infere ações a partir de pixels. A gravação preserva o exemplo declarado previamente, mostrando apenas a visão do Reflex-1. Reflex-1 · ViZDoom nativo36.5 s · VÍDEO SILENCIOSO [Ver Reflex-1 · ViZDoom (MP4)](https://www.goodailabs.com/media/reflex-1/preview/vizdoom-510001-clean.mp4). Reflex-1 · ViZDoom. Reflex-1 no ViZDoom 1.3.1 nativo, Defend the Center, dificuldade 5. Versão de 3 de outubro de 2026; semente de gravação declarada: 510001. O episódio completo termina em morte aos 34.514 dos 45 segundos de simulação permitidos, com 30 eliminações. Recebe rótulos visíveis do motor e vida/munição, não pixels. A reprodução segue o tempo da simulação, sem atrasos de inferência. A reprodução segue o tempo da simulação, sem atrasos de inferência; a pausa final original é preservada. Nos 32 episódios reservados, esta versão obteve média de 18.88 eliminações e 22.47 segundos de sobrevivência. Todos terminaram antes do limite de 45 segundos. O gráfico preserva todos os modelos externos avaliados e as contagens completas de episódios. ViZDoom · eliminações e limites de sobrevivência 3 de outubro de 2026 · versão de desenvolvimento 70a843878214 Defend the Center · dificuldade 5 Eliminações · maior é melhorMédia · intervalo de 95% - Reflex-10/32 chegaram a 45 s · 32 mortes · 0 erros · sobrevivência média 22.47 s 18.9IC de 95% 16.6–21.2 - Laya0/32 chegaram a 45 s · 32 mortes · 0 erros · sobrevivência média 4.90 s 1.4IC de 95% 1.2–1.6 - OpenJev · DeBERTa0/32 chegaram a 45 s · 32 mortes · 0 erros · sobrevivência média 4.90 s 1.4IC de 95% 1.2–1.6 - Kev-0.8B0/32 chegaram a 45 s · 32 mortes · 0 erros · sobrevivência média 4.90 s 1.4IC de 95% 1.2–1.6 010203040 Aqui Reflex-1 designa os pesos de desenvolvimento de 3 de outubro, não o download padrão nem uma versão final. Motor ViZDoom original, entradas de estado visível estruturado e ações argmax diretas; limite de 45 segundos. Todos os resultados declarados são preservados. Os intervalos da média reamostram sementes pareadas 10,000 vezes. Reservar sementes não garante estados estruturados inéditos. É uma comparação do adaptador e ambiente indicados, não um resultado oficial nem avaliação de política com entrada em pixels. Reflex-1 tem média de 18.88 eliminações e 22.47 segundos de sobrevivência, com 0/32 episódios de duração completa. Laya, OpenJev e Kev têm média de 1.375 eliminação cada e também completam 0/32. Os modelos de referência foram usados como distribuídos; seus treinamentos diferem. ### Fluxos de trabalho no navegador São sites WebGym sintéticos, distribuídos com Laya Browser e hospedados localmente. Os estados foram capturados em Chromium real, e o verificador original determina o sucesso. Reflex-1 seleciona ações e alvos; um auxiliar Qwen3-1.7B compartilhado fornece texto e valores de listas suspensas. O resultado avalia o sistema completo. Reflex-1 · WebGym sintético30.1 s · 4× · VÍDEO SILENCIOSO [Ver Reserva de restaurante · tarefa concluída (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-restaurant-960000-clean.mp4). Reserva de restaurante · tarefa concluída. Versão de desenvolvimento de 3 de outubro; 15 ações. Estados capturados no Chromium e reproduzidos a 4× o tempo real, com desfecho e pausa final completos. Tarefa sintética local com auxiliar de texto Qwen3-1.7B compartilhado. Esta versão difere dos pesos padrão do Hub. Reflex-1 · WebGym sintético8.1 s · 4× · VÍDEO SILENCIOSO [Ver Tarefa de compra · objetivo não concluído (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-shop-960000-clean.mp4). Tarefa de compra · objetivo não concluído. Versão de desenvolvimento de 3 de outubro; 4 ações. Estados capturados no Chromium e reproduzidos a 4× o tempo real, com desfecho e pausa final completos. Tarefa sintética local com auxiliar de texto Qwen3-1.7B compartilhado. Esta versão difere dos pesos padrão do Hub. A reserva de restaurante tem sucesso; a compra falha. Ambas usam a mesma semente de tarefa declarada previamente e preservam o desfecho. A reprodução ocorre a 4× o tempo real, mantendo os estados capturados e a pausa final. São resultados de desenvolvimento em sites sintéticos, não pontuações de MiniWoB++, WebArena ou sites reais. Conclusão de tarefas · WebGym sintético 3 de outubro de 2026 · versão de desenvolvimento 70a843878214 Episódios concluídos (%) · maior é melhorValor registrado - Reflex-1485 chamadas de decisão (0 erros) · 102 chamadas ao auxiliar (0 erros HTTP / 5 de contrato) 13/35 - Laya Browser505 chamadas de decisão (0 erros) · 100 chamadas ao auxiliar (0 erros HTTP / 7 de contrato) 17/35 - Laya56 chamadas de decisão (0 erros) · 12 chamadas ao auxiliar (0 erros HTTP / 0 de contrato) 0/35 - OpenJev · DeBERTa35 chamadas de decisão (24 erros) · 0 chamadas ao auxiliar (0 erros HTTP / 0 de contrato) 0/35 - Kev-0.8B196 chamadas de decisão (0 erros) · 82 chamadas ao auxiliar (0 erros HTTP / 0 de contrato) 1/35 0255075100 Aqui Reflex-1 designa os pesos de desenvolvimento de 3 de outubro, não o download padrão nem uma versão final. Captura real em Chromium de sites WebGym sintéticos locais. Todos os grupos usam o mesmo executor, auxiliar Qwen3-1.7B e limite de 40 passos. Reflex-1 usa autocast BF16 e 1,024 tokens de estado / 16,384 de solicitação; as demais condições estão no download. Inclui todas as 35 tentativas por grupo, falhas de solicitação e erros do auxiliar. É separado de MiniWoB++, WebArena e sites reais. A verificação final do site registra 13/35 conclusões para Reflex-1 e 17/35 para Laya Browser. O especialista segue à frente; os outros três grupos externos também aparecem. Reflex-1 concluiu 13/35 tarefas e Laya Browser 17/35. Os denominadores incluem todas as tentativas, falhas e erros de solicitação. Um piloto posterior no ambiente oficial MiniWoB++ concluiu 0/30 tarefas com esta versão; os resultados sintéticos não devem ser interpretados como sucesso nesse benchmark. ## Qualidade das decisões Typed Decisions abrange atendimento ao cliente, faturas, alertas de segurança e registros de agentes. A avaliação preserva os grupos de estados originais e solicita a cada modelo os mesmos cinco julgamentos por uma interface comum de opções. Reflex-1 acertou 1,508/2,000 julgamentos (75.4%). Decisões estruturadas 3 de outubro de 2026 · versão de desenvolvimento 70a843878214 Atendimento ao cliente Precisão (%) · quanto maior, melhorAcurácia · intervalo de 95% - Reflex-1383/500 corretas · 0 erros · 0 estados truncados 76.6%IC de 95% 72.0–80.8% - Laya · nativa210/500 corretas · 0 erros · 39 estados truncados 42.0%IC de 95% 38.2–45.8% - OpenJev · DeBERTa206/500 corretas · 0 erros · 350 estados truncados 41.2%IC de 95% 37.8–44.0% - Kev-0.8B314/500 corretas · 0 erros · 10 estados truncados 62.8%IC de 95% 58.2–67.4% 0255075100 Processamento de faturas Precisão (%) · quanto maior, melhorAcurácia · intervalo de 95% - Reflex-1394/500 corretas · 0 erros · 0 estados truncados 78.8%IC de 95% 75.0–82.4% - Laya · nativa192/500 corretas · 0 erros · 0 estados truncados 38.4%IC de 95% 32.6–44.6% - OpenJev · DeBERTa203/500 corretas · 0 erros · 500 estados truncados 40.6%IC de 95% 38.2–43.0% - Kev-0.8B252/500 corretas · 0 erros · 0 estados truncados 50.4%IC de 95% 45.2–55.8% 0255075100 Alertas de segurança Precisão (%) · quanto maior, melhorAcurácia · intervalo de 95% - Reflex-1362/500 corretas · 0 erros · 0 estados truncados 72.4%IC de 95% 68.4–76.2% - Laya · nativa167/500 corretas · 0 erros · 0 estados truncados 33.4%IC de 95% 30.0–37.0% - OpenJev · DeBERTa210/500 corretas · 0 erros · 275 estados truncados 42.0%IC de 95% 39.2–44.6% - Kev-0.8B236/500 corretas · 0 erros · 0 estados truncados 47.2%IC de 95% 42.6–51.8% 0255075100 Registros de agentes Precisão (%) · quanto maior, melhorAcurácia · intervalo de 95% - Reflex-1369/500 corretas · 0 erros · 0 estados truncados 73.8%IC de 95% 69.0–78.4% - Laya · nativa193/500 corretas · 0 erros · 0 estados truncados 38.6%IC de 95% 33.4–44.0% - OpenJev · DeBERTa192/500 corretas · 0 erros · 0 estados truncados 38.4%IC de 95% 34.6–42.2% - Kev-0.8B179/500 corretas · 0 erros · 0 estados truncados 35.8%IC de 95% 31.6–40.4% 0255075100 Aqui Reflex-1 designa os pesos de desenvolvimento de 3 de outubro, não o download padrão nem uma versão final. 400 estados-fonte reservados são expandidos para 2,000 julgamentos, 500 por fluxo. Os intervalos reamostram estados-fonte preservando as cinco cabeças relacionadas. Limites de tokens: Reflex-1: estado 1,024, solicitação 4,096; Laya · nativo: solicitação 512, instrução/opções 192; OpenJev · DeBERTa: estado 256, solicitação 512; Kev-0.8B: estado 512, ramo incluindo estado 2,048. Encurtamentos de instruções/opções em toda a coorte (não somáveis entre gráficos): Laya · nativo 0/2,000. Essas contagens são separadas dos estados truncados acima. Concordância com a escolha mais frequente do professor por uma interface comum. São resultados de dados adaptados, não uma pontuação oficial de múltiplas cabeças. Na coorte reservada de CLINC, Reflex-1 acertou 3,680/4,490 solicitações de intenção ou fora do escopo (82.0%). Na seleção de ferramentas desconhecidas acertou 72/87, abaixo do melhor resultado externo de 82/87. Os pontos fortes e as limitações aparecem abaixo. Roteamento de intenções 3 de outubro de 2026 · versão de desenvolvimento 70a843878214 Solicitações conhecidas e desconhecidas Precisão (%) · quanto maior, melhorAcurácia · intervalo de 95% - Reflex-13,680/4,490 corretas · 0 erros · 0 estados truncados · 64 rejeições incorretas · 370 aceitações incorretas 82.0%IC de 95% 80.8–83.1% - Laya · nativa1,425/4,490 corretas · 0 erros · 0 estados truncados · 0 rejeições incorretas · 942 aceitações incorretas 31.7%IC de 95% 30.3–33.2% - Laya · expandida1,017/4,490 corretas · 0 erros · 0 estados truncados · 0 rejeições incorretas · 942 aceitações incorretas 22.7%IC de 95% 21.4–23.9% - OpenJev · DeBERTa2,496/4,490 corretas · 0 erros · 0 estados truncados · 5 rejeições incorretas · 939 aceitações incorretas 55.6%IC de 95% 54.1–57.0% - Kev-0.8B2,298/4,490 corretas · 0 erros · 0 estados truncados · 1 rejeições incorretas · 937 aceitações incorretas 51.2%IC de 95% 49.6–52.6% 0255075100 Aqui Reflex-1 designa os pesos de desenvolvimento de 3 de outubro, não o download padrão nem uma versão final. 4,490 solicitações reservadas: 3,548 intenções conhecidas e 942 fora do escopo. São mostrados Laya nativo e seu controle de contexto ampliado declarado separadamente. Limites de tokens: Reflex-1: estado 1,024, solicitação 4,096; Laya · nativo: solicitação 512, instrução/opções 192; Laya · ampliado: solicitação 2,048, instrução/opções 1,536; OpenJev · DeBERTa: estado 256, solicitação 512; Kev-0.8B: estado 512, ramo incluindo estado 2,048. Encurtamentos de instruções/opções em toda a coorte (não somáveis entre gráficos): Laya · nativo 4,490/4,490; Laya · ampliado 0/4,490. Essas contagens são separadas dos estados truncados acima. Reflex-1 encaminha corretamente 3,108/3,548 solicitações conhecidas e rejeita 572/942 fora do escopo. Rejeita incorretamente 64 conhecidas e aceita 370 fora do escopo. Todas as condições externas são preservadas. Seleção entre ferramentas desconhecidas 3 de outubro de 2026 · versão de desenvolvimento 70a843878214 Seleção de ferramentas Precisão (%) · quanto maior, melhorAcurácia · intervalo de 95% - Reflex-172/87 corretas · 0 erros · 0 estados truncados 82.8%IC de 95% 74.7–90.8% - Laya · nativa80/87 corretas · 0 erros · 14 estados truncados 92.0%IC de 95% 86.2–97.7% - Laya · expandida80/87 corretas · 0 erros · 0 estados truncados 92.0%IC de 95% 86.2–97.7% - OpenJev · DeBERTa82/87 corretas · 0 erros · 30 estados truncados 94.3%IC de 95% 88.5–98.9% - Kev-0.8B81/87 corretas · 0 erros · 1 estados truncados 93.1%IC de 95% 87.4–97.7% 0255075100 Aqui Reflex-1 designa os pesos de desenvolvimento de 3 de outubro, não o download padrão nem uma versão final. 87 solicitações reservadas, com nomes de ferramentas e estados normalizados separados antes do treinamento. É uma adaptação de escolha de ferramentas; gerar argumentos e executar está fora do escopo. Limites de tokens: Reflex-1: estado 1,024, solicitação 4,096; Laya · nativo: solicitação 512, instrução/opções 192; Laya · ampliado: solicitação 2,048, instrução/opções 1,536; OpenJev · DeBERTa: estado 256, solicitação 512; Kev-0.8B: estado 512, ramo incluindo estado 2,048. Encurtamentos de instruções/opções em toda a coorte (não somáveis entre gráficos): Laya · nativo 87/87; Laya · ampliado 65/87. Essas contagens são separadas dos estados truncados acima. Reflex-1 seleciona corretamente 72/87 ferramentas. Laya chega a 80/87 em cada condição declarada, OpenJev a 82/87 e Kev a 81/87. Avalia-se a escolha entre ferramentas fornecidas, não a geração de argumentos ou a execução. São adaptações a opções comuns com coortes declaradas, não submissões a rankings oficiais. Os modelos externos foram avaliados como distribuídos, sem o treinamento específico do Reflex-1. As figuras preservam os intervalos de incerteza, orçamentos de tokens e contagens de truncamento originais. ## Velocidade e recursos As medições desta seção descrevem o checkpoint de 2 de outubro. As medições do checkpoint atual estão disponíveis na ficha do modelo vinculada acima. ### latência de solicitação do H200 Reproduzimos 120 solicitações distintas duas vezes por modelo em um NVIDIA H200 compartilhado. Eles vieram de cinco ambientes de jogos e navegadores. Cada modelo recebeu as mesmas informações, com uma solicitação em andamento por vez. latência de solicitação do H200 120 entradas · duas repetições · uma solicitação em voo Milissegundos · quanto menor, mais rápidoMediana//p95 - Reflex-1FP32 27.5 / 30.5 - OpenJevFP32 32.0 / 33.8 - Laya (nativa)BF16 27.1 / 142.0 - Laya (repetição de FP32)FP32 40.2 / 44.4 04080120160 Ponto: mediana. Fim da linha: p95. Inclui tokenização, pontuação e loopback HTTP; exclui carregamento e aquecimento. 120 entradas idênticas, cada uma repetida duas vezes, com uma solicitação em andamento. O tempo inclui formatação, tokenização, inferência e loopback HTTP. Os intervalos mostram uma mediana de p95. A precisão difere conforme rotulado; o replay de FP32 Laya mudou duas decisões. Tabela de medição e protocolo completos H200 · solicitações idênticas · latência em milissegundos · quanto menor, melhor modelo | Recursos computacionais | Mediana | p95 | reflex-1 | FP32 | 27.5 | 30.5 | OpenJev | FP32 | 32.0 | 33.8 | Laya (nativa) | BF16 | 27.1 | 142.0 | Laya (repetição de FP32) | FP32 | 40.2 | 44.4 | O Laya native usa o autocast BF16; um replay de FP32 separado também está incluído. OpenJev é o checkpoint público de DeBerta, não o Jev hospedado. Esses tempos de solicitação não medem o sucesso da tarefa ou a taxa de transferência simultânea. Gravado em 2026-09-29. A mediana do reflex-1 foi de 27.5 ms e o p95 de 30.5 ms. Ele foi mais rápido que OpenJev em FP32 e que Laya na medição separada em FP32. A configuração nativa de Laya usou autocast BF16 e teve uma mediana ligeiramente menor. A máquina compartilhada e o tamanho da amostra limitam as conclusões sobre resultados próximos. O cronômetro inclui tokenização, pontuação do modelo, normalização de saída e HTTP de loopback. Isso exclui o carregamento e três solicitações de aquecimento. Os caches de respostas e opções foram desativados. Não medimos a taxa de transferência simultânea de serviços nesta execução. O OpenJev aqui é o checkpoint público do DeBerta; não é o serviço Jev hospedado. ### latência DE CPU M4 O teste de CPU usou um MacBook Air M4, FP32 e tamanho de lote um. Cada modelo usou um thread intra-op PyTorch, um thread inter-op e um limite de thread BLAS de um. Cada tarefa teve 24 casos distintos, cada um repetido duas vezes. A ordem do modelo foi balanceada em oito blocos de execução. latência de solicitação de CPU M4 FP32 · lote um · threads PyTorch 1/1 · limite BLAS 1 Banking77 Milissegundos · escala logarítmica · quanto menor, mais rápidoMediana//p95 - Reflex-1 345.2 / 692.0 - OpenJev 1,332.6 / 2,857.1 - Laya 912.4 / 2,649.9 - Kev 4,283.4 / 11,073.7 1001k10k20k Emotion Milissegundos · escala logarítmica · quanto menor, mais rápidoMediana//p95 - Reflex-1 256.2 / 610.4 - OpenJev 381.8 / 1,029.5 - Laya 240.1 / 427.7 - Kev 1,121.9 / 4,422.3 1001k10k20k AG News Milissegundos · escala logarítmica · quanto menor, mais rápidoMediana//p95 - Reflex-1 321.7 / 578.7 - OpenJev 424.5 / 934.0 - Laya 324.1 / 760.5 - Kev 1,356.5 / 4,997.2 1001k10k20k SST-5 Milissegundos · escala logarítmica · quanto menor, mais rápidoMediana//p95 - Reflex-1 299.1 / 631.0 - OpenJev 360.5 / 894.5 - Laya 250.7 / 548.5 - Kev 902.2 / 4,480.5 1001k10k20k BoolQ Milissegundos · escala logarítmica · quanto menor, mais rápidoMediana//p95 - Reflex-1 463.4 / 1,329.1 - OpenJev 451.9 / 1,398.9 - Laya 440.4 / 1,587.9 - Kev 1,775.3 / 6,548.0 1001k10k20k Ponto: mediana. Extremidade da linha: p95. Todas as tarefas usam a mesma escala logarítmica. Memória: RSS máximo do processo de 1.50 GiB em uma medição separada do Reflex-1; a memória de cada modelo não foi medida nesta comparação. FP32, lote de tamanho um; PyTorch usa 1/1 threads intraoperação/interoperação e BLAS fica limitado a 1 thread. Estudo de latência original: 24 entradas por tarefa, cada uma repetida duas vezes. Uma medição separada de 240 solicitações do Reflex-1 registrou 1.50 GiB de RSS máximo do processo, incluindo carregamento, aquecimento e inferência. A comparação original não registrou memória por modelo. Os segmentos vão da mediana ao p95. Laya trunca as opções de Banking77; Kev usa kernels de CPU de referência com adaptadores não fundidos. Tabela de medição e protocolo completos CPU M4 · FP32 · PyTorch intra-op/inter-op 1/1 · Limite de BLAS 1 · mediana/p95 em milissegundos Tarefa | reflex-1 | OpenJev | Laya | Kev | Banking77 | 345.2/ 692.0 | 1332.6/ 2857.1 | 912.4/ 2649.9 | 4283.4/ 11073.7 | Emotion | 256.2/ 610.4 | 381.8/ 1029.5 | 240.1/ 427.7 | 1121.9/ 4422.3 | AG News | 321.7/ 578.7 | 424.5/ 934.0 | 324.1/ 760.5 | 1356.5/ 4997.2 | SST-5 | 299.1/ 631.0 | 360.5/ 894.5 | 250.7/ 548.5 | 902.2/ 4480.5 | BoolQ | 463.4/ 1329.1 | 451.9/ 1398.9 | 440.4/ 1587.9 | 1775.3/ 6548.0 | Orçamentos de tempo de execução nativos. Laya trunca as opções do Banking77 de acordo com seu orçamento nativo; os resultados do orçamento expandido são relatados separadamente. Kev usa seus kernels de referência de CPU e adaptadores não mesclados. Gravado em 2026-09-24. Memória medida Reflex-1: RSS de processo de pico de 1.50 GiB. Reprodução separada do recurso Reflex-1 das 120 entradas originais, cada uma pontuada duas vezes. O pico de RSS de todo o processo inclui importações, carregamento de modelos, aquecimento e inferência. A comparação original de latência de quatro modelos não registrou memória por modelo. Gravado em 2026-10-02 UTC. [Medições e protocolo de recursos](https://huggingface.co/Goodailabs/reflex-1/resolve/main/assets/cpu-resources.json). Banking77 exige escolher entre 77 intenções. A mediana do reflex-1 foi de 345.2 ms, contra 1,332.6 ms do OpenJev na mesma execução. Nas cinco tarefas, as medianas do reflex-1 variaram de 256.2 a 463.4 ms. Laya foi mais rápida em várias tarefas de menor escolha. Seu orçamento nativo do Banking77 truncou as opções, então seu cronograma cobre um conjunto reduzido de candidatos. Kev usou kernels de referência de CPU com adaptadores não mesclados. A atividade em segundo plano do laptop contribuiu para as maiores latências traseiras. Este teste mede desde a construção da solicitação até a saída normalizada, com o modelo já carregado. Os testes de CPU e GPU usam solicitações diferentes; seus tempos não permitem calcular diretamente o ganho de velocidade da GPU em relação à CPU. ### Precisão em tarefas conhecidas O reflex-1 obteve uma pontuação de 95.0% no Banking77 e 92.2% no Emotion. Ele liderou os pontos de verificação comparados em ambos, empatou a melhor pontuação na AG News e no SST-5 e teve uma pontuação um pouco abaixo do OpenJev no BoolQ. Precisão de decisão 500 exemplos por tarefa · diagnósticos de desenvolvimento Banking77 Precisão (%) · quanto maior, melhorValor registrado - Reflex-1 95.0% - OpenJev 90.6% - Laya · nativa 44.4% - Laya · expandida 55.4% - Kev 82.4% 050100 Emotion Precisão (%) · quanto maior, melhorValor registrado - Reflex-1 92.2% - OpenJev 53.0% - Laya · nativa 57.6% - Laya · expandida 57.6% - Kev 54.4% 050100 AG News Precisão (%) · quanto maior, melhorValor registrado - Reflex-1 91.2% - OpenJev 77.4% - Laya · nativa 91.2% - Laya · expandida 91.2% - Kev 87.2% 050100 SST-5 Precisão (%) · quanto maior, melhorValor registrado - Reflex-1 59.8% - OpenJev 59.8% - Laya · nativa 51.0% - Laya · expandida 51.0% - Kev 55.2% 050100 BoolQ Precisão (%) · quanto maior, melhorValor registrado - Reflex-1 86.0% - OpenJev 86.8% - Laya · nativa 71.2% - Laya · expandida 71.2% - Kev 82.6% 050100 As famílias de tarefas foram incluídas no treinamento e esses subconjuntos foram inspecionados durante o desenvolvimento. A exposição ao treinamento difere entre os modelos. O orçamento nativo de Laya trunca as opções do Banking77. Cada modelo recebeu os mesmos 500 exemplos por tarefa. Essas famílias de tarefas foram incluídas no treinamento Reflex e os subconjuntos foram inspecionados durante o desenvolvimento. A exposição ao treinamento difere entre os modelos. A Laya, de orçamento expandido, mantém todas as 77 etiquetas do Banking77. Tabela de medição e protocolo completos Precisão (%) · 500 exemplos por tarefa · diagnósticos de desenvolvimento Tarefa | reflex-1 | Laya, nativa | Laya, expandida | OpenJev | Kev | Banking77 | 95.0 | 44.4 | 55.4 | 90.6 | 82.4 | Emotion | 92.2 | 57.6 | 57.6 | 53.0 | 54.4 | AG News | 91.2 | 91.2 | 91.2 | 77.4 | 87.2 | SST-5 | 59.8 | 51.0 | 51.0 | 59.8 | 55.2 | BoolQ | 86.0 | 71.2 | 71.2 | 86.8 | 82.6 | O Laya SDK 0.3.20 é mostrado com orçamentos de tokens nativos e expandidos. O orçamento nativo do Banking77 trunca o conjunto de opções; o orçamento expandido retém todos os 77 rótulos. Esses são diagnósticos de desenvolvimento, não avaliações de transferência independentes. Foram 500 exemplos de diagnósticos por tarefa. As famílias de tarefas foram incluídas no treinamento e inspecionamos os subconjuntos durante o desenvolvimento. Os orçamentos de treinamento e a exposição anterior diferem entre os modelos. A precisão foi medida separadamente da latência, em mais exemplos. O checkpoint geral concluiu 0 dos 80 testes com nosso controlador de navegador personalizado. O resultado expõe uma lacuna substancial entre a classificação de tarefas familiares e o controle autônomo. A transferência para perguntas desconhecidas e a calibração de probabilidade permanecem como problemas de avaliação abertos. ### Treinamento e armazenamento O modelo de serviço tem 420,778,370 parâmetros após a fusão dos adaptadores. O ModernBERT codifica o estado e as perguntas; um codificador MiniLM congelado representa as opções. A cabeça compartilhada combina suas representações. reflex-1 · tamanho da porção e orçamento de adaptação Recurso | Configuração gravada | Parâmetros de serviço | 420,778,370 | Parâmetros treinados em adaptação | 9,036,290 | Hardware de adaptação | 1 × NVIDIA H200 | Corrida principal | 6,000 atualizações · 75 min 7 seg | Modelo FP32 extraído no disco | ≈ 1.69 GB | Memória de processo medida da CPU | RSS de pico de 1.50 GiB · reprodução separada de 240 solicitações | Threads de computação da CPU | PyTorch intra-op/inter-op 1/1 · Limite 1 de BLAS | A principal execução de adaptação atualizou 9,036,290 parâmetros em 6,000 etapas, usando 290,657 registros de oito famílias de tarefas. Foram necessários 75 minutos e 7 segundos em um H200, incluindo telas de desenvolvimento e salvamentos de checkpoint. O pré-treinamento do modelo básico, a preparação de dados, o ajuste da projeção e os experimentos anteriores são custos adicionais. O modelo FP32 extraído ocupa cerca de 1.69 GB em disco. A medição separada de recursos de CPU registrou 1.50 GiB de RSS máximo do processo, incluindo alocações do framework, tokenizadores, carregamento, aquecimento e inferência. O uso de memória de GPU ainda não foi medido. ## Acesso ao modelo A [versão pública Hugging Face](https://huggingface.co/gai-labs/reflex-1) contém os pesos FP32 de 1.68 GB, ambos tokenizadores e uma implementação independente de Transformers no Apache 2.0. Nenhuma conta, chave de API ou acesso ao GitHub é necessário. Use o Python 3.12: ``` python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0" ``` ``` import torch from transformers import AutoModel torch.set_num_threads(1) model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True) decision = model.predict( state="The customer was charged twice for one card payment.", question="Choose the matching issue.", options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"], )[0] print(decision.choice) ``` Carregue o modelo uma vez e reutilize-o. O cartão modelo documenta inferência em lote, várias perguntas, carregamento offline e hashes de lançamento. O repositório de desenvolvimento permanece privado; o pacote público inclui o código necessário para a inferência. O treinamento original utilizou RACE e SciQ, cujos termos incluem restrições não comerciais. A [ficha do modelo](https://huggingface.co/gai-labs/reflex-1) documenta o uso e as revisões fixas. A análise de procedência não determina como esses termos se aplicam aos pesos treinados. ## Gravações e reprodução dos resultados Use a [revisão fixa do Hub de 3 de outubro](https://huggingface.co/gai-labs/reflex-1/tree/ae50bf81cddcaaac2aa18021d862433ca69da197) para reproduzir estas gravações. Os gráficos preservam os resultados medidos, incluindo perdas de capacidades anteriores. Cada gravação identifica o ambiente, o formato de entrada e a velocidade de reprodução. A versão atual tem uma avaliação separada, acessível pela ficha do modelo. Estas gravações e estudos preservam seus resultados originais. Também em pesquisa ## Também em pesquisa - ### [Samsara-VLA](https://www.goodailabs.com/pt/research/samsara-vla/) Duas políticas robóticas compactas para manipulação guiada por linguagem. Veja como pegam, colocam, abrem e concluem tarefas de várias etapas. - ### [VIO-lens-2](https://www.goodailabs.com/pt/research/vio-lens-2/) Pesquisa em andamento. Correspondência ## Escreva para nós Entre em contato conosco sobre avaliações, acesso a modelos ou colaboração de pesquisa. [research@goodailabs.com](mailto:research@goodailabs.com?subject=Reflex-1)