Pesquisa Pesos públicos
Reflex-1
Modelos de decisão para agentes
Um modelo de decisão de 421M parâmetros para agentes. Uma única passagem, em CPU ou GPU.
Pesos ajustados disponíveis no Hugging Face.
Visão geral
Muitas decisões do agente terminam com uma escolha: qual fila recebe uma solicitação, qual ferramenta se encaixa em uma tarefa ou qual ação vem a seguir. O Reflex-1 pontua as opções que seu aplicativo fornece em um único passe para frente. Ele retorna uma distribuição de probabilidade que o aplicativo pode usar para tomar essa decisão.
A pesquisa segue a direção dos modelos de decisão explorada pelo Jev, com arquitetura e procedimento de treinamento supervisionado próprios. Um codificador de contexto com 28 camadas e outro de candidatos com seis camadas alimentam uma camada de pontuação compartilhada. O checkpoint atual atualiza todos os 420,778,370 parâmetros.
O download público padrão fornece o checkpoint ajustado mais recente. Sua ficha contém os resultados de avaliação e as medições atuais de CPU. Os estudos e as gravações com data abaixo preservam a identificação de seus checkpoints originais.
Modelo de decisão
Versão pública · ambiente de execução 1.0.0- Uso
- Escolha entre as opções fornecidas por um aplicativo: rótulos, rotas ou ações possíveis.
- Entrada → saída
- Estado, pergunta e 1—255 opções → uma distribuição de escolha em uma passagem para frente.
- modelo
- 421M parâmetros. Um codificador de contexto com 28 camadas, outro de candidatos com 6 camadas e uma camada de pontuação compartilhada.
- Execute localmente
- CPU ou GPU · FP32. A reprodução atual em CPU mediu 2.17 GiB de pico de memória do processo com uma ou quatro threads de computação.
- Avaliação
- 92.93% em um subconjunto reservado de 495 casos do Banking77; 21/30 episódios nativos do MiniWoB++. Essas famílias de tarefas estão representadas no treinamento.
- Acesso
- Pesos públicos, tokenizadores e código de inferência no Apache 2.0. Texto em inglês; tempo de execução 1.0.0.
O download padrão fornece o checkpoint ajustado mais recente. Os estudos e as gravações com data abaixo descrevem checkpoints anteriores. A aplicação fornece as opções e controla a execução.
Resultados atuais
A versão de 5 de outubro concluiu 21/30 episódios nativos de navegador MiniWoB++ com um controlador fixo. Obteve 92.93% em 495 exemplos de Banking77. São subconjuntos reservados de famílias de tarefas presentes no treinamento, não pontuações de benchmarks completos.
| Tarefa | Acertos / avaliados | Acurácia |
|---|---|---|
| AG News | 465 / 500 | 93.00% |
| SST-5 | 299 / 500 | 59.80% |
| Emotion | 458 / 500 | 91.60% |
| Banking77 | 460 / 495 | 92.93% |
| BoolQ | 171 / 202 | 84.65% |
| MNLI | 436 / 500 | 87.20% |
| RACE | 287 / 500 | 57.40% |
| SciQ | 123 / 128 | 96.09% |
Em uma CPU Intel Xeon Platinum 8558, a inferência de Banking77 levou 375.2 ms de mediana e 452.1 ms de p95 com quatro threads de computação. O pico de memória do processo foi de 2.17 GiB, incluindo carregamento, aquecimento e inferência.
Medições atuais em CPU
Intel Xeon Platinum 8558 · FP32 · lote de 1Uma thread de computação
- AG News 1209.7 / 1385.0 ms
- SST-5 973.6 / 1160.3 ms
- Emotion 956.9 / 1165.8 ms
- Banking77 1101.7 / 1276.9 ms
- BoolQ 1600.8 / 2710.6 ms
Quatro threads de computação
- AG News 389.5 / 480.4 ms
- SST-5 320.6 / 404.2 ms
- Emotion 318.8 / 391.0 ms
- Banking77 375.2 / 452.1 ms
- BoolQ 486.7 / 782.2 ms
480 chamadas por configuração de threads sobre 120 entradas em dois processos novos. Inclui tokenização e inferência; exclui carregamento e aquecimento. Host compartilhado, ambiente de avaliação e sem cache entre solicitações.
A avaliação completa ainda está pendente. BoolQ, RACE e o diagnóstico público JevBench regrediram em relação ao checkpoint anterior; Dino nativo atingiu a meta de 60 segundos em 0/16 tentativas. A latência atual em GPU não foi medida. A avaliação publicada registra o checkpoint, as condições e as verificações pendentes.
Como funciona
As respostas dos candidatos são fornecidas com cada solicitação. O modelo suporta de 1 a 255 opções por pergunta, dentro de seus limites simbólicos, e várias perguntas podem compartilhar um estado compactado. Um aplicativo de suporte pode fornecer suas próprias filas; um agente pode fornecer descrições das ferramentas disponíveis. Novos tipos de decisão precisam de seus próprios testes de precisão.
O modelo pontua as opções fornecidas; o aplicativo constrói argumentos da ferramenta
e decide quais ações são permitidas. O texto do estado é limitado a 512 tokens de
tokenizador de contexto e pode ser reduzido ainda mais de acordo com o orçamento da solicitação.
Cada opção aceita até 512 tokens de tokenizador de opções. Inspecione state_truncated
quando o contexto pode ter sido reduzido.
Reflex-1/ Modelo de decisão
De uma pergunta a uma escolha.
01 / Fornecer
Defina a decisão.
Seu aplicativo fornece o estado, uma pergunta e as opções sobre as quais ela pode agir. Essas opções podem mudar a cada solicitação: filas de suporte, ferramentas disponíveis ou ações permitidas.
Estado + pergunta
O cliente foi cobrado duas vezes.
Qual problema corresponde?Contexto + perguntaModernBERTCada escolhaMiniLMCabeça de pontuação compartilhadaProbabilidades de escolhaAplicaçãoPermissão → argumentos → açãoSolicitação de suporte ilustrativa. O aplicativo define o conjunto de candidatos. 02 / Codificar
Represente o contexto e os candidatos.
Um codificador ModernBERT adaptado lê o estado e a pergunta. Um codificador MiniLM congelado representa cada opção fornecida. Várias perguntas podem compartilhar um estado lotado.
Estado + pergunta
O cliente foi cobrado duas vezes.
Qual problema corresponde?Contexto + perguntaModernBERTCada escolhaMiniLMCabeça de pontuação compartilhadaProbabilidades de escolhaAplicaçãoPermissão → argumentos → açãoDois codificadores alimentam uma cabeça de pontuação compartilhada. Esse é um esquema da arquitetura de pré-visualização. 03 / Pontuar
Marque todas as opções fornecidas em um passe.
A cabeça compartilhada combina o contexto e as representações dos candidatos e, em seguida, retorna uma distribuição de probabilidade sobre as opções fornecidas. Novos tipos de decisão ainda precisam de testes de precisão e calibração.
Estado + pergunta
O cliente foi cobrado duas vezes.
Qual problema corresponde?Contexto + perguntaModernBERTCada escolhaMiniLMCabeça de pontuação compartilhadaProbabilidades de escolhaAplicaçãoPermissão → argumentos → açãoUma pontuação por candidato fornecido, normalizada para uma distribuição de probabilidade. 04 / Agir
Deixe que o aplicativo execute a decisão.
O aplicativo decide quais ações são permitidas, constrói quaisquer argumentos da ferramenta e executa a ação selecionada. O Reflex-1 fornece as pontuações; o sistema circundante possui o circuito de controle.
Estado + pergunta
O cliente foi cobrado duas vezes.
Qual problema corresponde?Contexto + perguntaModernBERTCada escolhaMiniLMCabeça de pontuação compartilhadaProbabilidades de escolhaAplicaçãoPermissão → argumentos → açãoO limite do aplicativo é importante: pontuar uma ferramenta não a executa.
Arquitetura da prévia do desenvolvimento público. A solicitação de suporte ilustra o formato de entrada.
Exemplos
Os exemplos e as comparações de qualidade de decisão abaixo usam o snapshot de 3 de outubro. As medições de velocidade e recursos são identificadas separadamente. Cada gravação preserva seu desfecho observado, incluindo falhas.
Chromium Dino
Esta gravação usa o jogo original chrome://dino do Chromium. Reflex-1 recebe a geometria dos obstáculos visíveis e escolhe correr, pular ou abaixar. Eventos nativos de teclado executam essas escolhas enquanto o relógio do jogo continua durante a inferência. O vídeo mostra quadros reais do navegador em velocidade normal.
As duas tentativas terminaram em colisão após 42.31 segundos e 30.41 segundos; nenhuma atingiu o limite de 60 segundos. A mais longa aparece primeiro. Os percursos aleatórios são independentes, portanto não permitem uma comparação pareada entre modelos. A segunda tentativa completa está preservada abaixo.
Assista à segunda tentativa de Dino
ViZDoom
O jogo é o cenário Defend the Center do ViZDoom nativo, na dificuldade 5. Reflex-1 escolhe ações a partir dos limites de objetos visíveis, vida e munição. É um controlador de estado estruturado; não infere ações a partir de pixels. A gravação preserva o exemplo declarado previamente, mostrando apenas a visão do Reflex-1.
Nos 32 episódios reservados, esta versão obteve média de 18.88 eliminações e 22.47 segundos de sobrevivência. Todos terminaram antes do limite de 45 segundos. O gráfico preserva todos os modelos externos avaliados e as contagens completas de episódios.
ViZDoom · eliminações e limites de sobrevivência
3 de outubro de 2026 · versão de desenvolvimento 70a843878214Defend the Center · dificuldade 5
- Reflex-10/32 chegaram a 45 s · 32 mortes · 0 erros · sobrevivência média 22.47 s 18.9IC de 95% 16.6–21.2
- Laya0/32 chegaram a 45 s · 32 mortes · 0 erros · sobrevivência média 4.90 s 1.4IC de 95% 1.2–1.6
- OpenJev · DeBERTa0/32 chegaram a 45 s · 32 mortes · 0 erros · sobrevivência média 4.90 s 1.4IC de 95% 1.2–1.6
- Kev-0.8B0/32 chegaram a 45 s · 32 mortes · 0 erros · sobrevivência média 4.90 s 1.4IC de 95% 1.2–1.6
Aqui Reflex-1 designa os pesos de desenvolvimento de 3 de outubro, não o download padrão nem uma versão final. Motor ViZDoom original, entradas de estado visível estruturado e ações argmax diretas; limite de 45 segundos. Todos os resultados declarados são preservados. Os intervalos da média reamostram sementes pareadas 10,000 vezes. Reservar sementes não garante estados estruturados inéditos. É uma comparação do adaptador e ambiente indicados, não um resultado oficial nem avaliação de política com entrada em pixels.
Fluxos de trabalho no navegador
São sites WebGym sintéticos, distribuídos com Laya Browser e hospedados localmente. Os estados foram capturados em Chromium real, e o verificador original determina o sucesso. Reflex-1 seleciona ações e alvos; um auxiliar Qwen3-1.7B compartilhado fornece texto e valores de listas suspensas. O resultado avalia o sistema completo.
A reserva de restaurante tem sucesso; a compra falha. Ambas usam a mesma semente de tarefa declarada previamente e preservam o desfecho. A reprodução ocorre a 4× o tempo real, mantendo os estados capturados e a pausa final. São resultados de desenvolvimento em sites sintéticos, não pontuações de MiniWoB++, WebArena ou sites reais.
Conclusão de tarefas · WebGym sintético
3 de outubro de 2026 · versão de desenvolvimento 70a843878214- Reflex-1485 chamadas de decisão (0 erros) · 102 chamadas ao auxiliar (0 erros HTTP / 5 de contrato) 13/35
- Laya Browser505 chamadas de decisão (0 erros) · 100 chamadas ao auxiliar (0 erros HTTP / 7 de contrato) 17/35
- Laya56 chamadas de decisão (0 erros) · 12 chamadas ao auxiliar (0 erros HTTP / 0 de contrato) 0/35
- OpenJev · DeBERTa35 chamadas de decisão (24 erros) · 0 chamadas ao auxiliar (0 erros HTTP / 0 de contrato) 0/35
- Kev-0.8B196 chamadas de decisão (0 erros) · 82 chamadas ao auxiliar (0 erros HTTP / 0 de contrato) 1/35
Aqui Reflex-1 designa os pesos de desenvolvimento de 3 de outubro, não o download padrão nem uma versão final. Captura real em Chromium de sites WebGym sintéticos locais. Todos os grupos usam o mesmo executor, auxiliar Qwen3-1.7B e limite de 40 passos. Reflex-1 usa autocast BF16 e 1,024 tokens de estado / 16,384 de solicitação; as demais condições estão no download. Inclui todas as 35 tentativas por grupo, falhas de solicitação e erros do auxiliar. É separado de MiniWoB++, WebArena e sites reais.
Reflex-1 concluiu 13/35 tarefas e Laya Browser 17/35. Os denominadores incluem todas as tentativas, falhas e erros de solicitação. Um piloto posterior no ambiente oficial MiniWoB++ concluiu 0/30 tarefas com esta versão; os resultados sintéticos não devem ser interpretados como sucesso nesse benchmark.
Qualidade das decisões
Typed Decisions abrange atendimento ao cliente, faturas, alertas de segurança e registros de agentes. A avaliação preserva os grupos de estados originais e solicita a cada modelo os mesmos cinco julgamentos por uma interface comum de opções. Reflex-1 acertou 1,508/2,000 julgamentos (75.4%).
Decisões estruturadas
3 de outubro de 2026 · versão de desenvolvimento 70a843878214Atendimento ao cliente
- Reflex-1383/500 corretas · 0 erros · 0 estados truncados 76.6%IC de 95% 72.0–80.8%
- Laya · nativa210/500 corretas · 0 erros · 39 estados truncados 42.0%IC de 95% 38.2–45.8%
- OpenJev · DeBERTa206/500 corretas · 0 erros · 350 estados truncados 41.2%IC de 95% 37.8–44.0%
- Kev-0.8B314/500 corretas · 0 erros · 10 estados truncados 62.8%IC de 95% 58.2–67.4%
Processamento de faturas
- Reflex-1394/500 corretas · 0 erros · 0 estados truncados 78.8%IC de 95% 75.0–82.4%
- Laya · nativa192/500 corretas · 0 erros · 0 estados truncados 38.4%IC de 95% 32.6–44.6%
- OpenJev · DeBERTa203/500 corretas · 0 erros · 500 estados truncados 40.6%IC de 95% 38.2–43.0%
- Kev-0.8B252/500 corretas · 0 erros · 0 estados truncados 50.4%IC de 95% 45.2–55.8%
Alertas de segurança
- Reflex-1362/500 corretas · 0 erros · 0 estados truncados 72.4%IC de 95% 68.4–76.2%
- Laya · nativa167/500 corretas · 0 erros · 0 estados truncados 33.4%IC de 95% 30.0–37.0%
- OpenJev · DeBERTa210/500 corretas · 0 erros · 275 estados truncados 42.0%IC de 95% 39.2–44.6%
- Kev-0.8B236/500 corretas · 0 erros · 0 estados truncados 47.2%IC de 95% 42.6–51.8%
Registros de agentes
- Reflex-1369/500 corretas · 0 erros · 0 estados truncados 73.8%IC de 95% 69.0–78.4%
- Laya · nativa193/500 corretas · 0 erros · 0 estados truncados 38.6%IC de 95% 33.4–44.0%
- OpenJev · DeBERTa192/500 corretas · 0 erros · 0 estados truncados 38.4%IC de 95% 34.6–42.2%
- Kev-0.8B179/500 corretas · 0 erros · 0 estados truncados 35.8%IC de 95% 31.6–40.4%
Aqui Reflex-1 designa os pesos de desenvolvimento de 3 de outubro, não o download padrão nem uma versão final. 400 estados-fonte reservados são expandidos para 2,000 julgamentos, 500 por fluxo. Os intervalos reamostram estados-fonte preservando as cinco cabeças relacionadas. Limites de tokens: Reflex-1: estado 1,024, solicitação 4,096; Laya · nativo: solicitação 512, instrução/opções 192; OpenJev · DeBERTa: estado 256, solicitação 512; Kev-0.8B: estado 512, ramo incluindo estado 2,048. Encurtamentos de instruções/opções em toda a coorte (não somáveis entre gráficos): Laya · nativo 0/2,000. Essas contagens são separadas dos estados truncados acima.
Na coorte reservada de CLINC, Reflex-1 acertou 3,680/4,490 solicitações de intenção ou fora do escopo (82.0%). Na seleção de ferramentas desconhecidas acertou 72/87, abaixo do melhor resultado externo de 82/87. Os pontos fortes e as limitações aparecem abaixo.
Roteamento de intenções
3 de outubro de 2026 · versão de desenvolvimento 70a843878214Solicitações conhecidas e desconhecidas
- Reflex-13,680/4,490 corretas · 0 erros · 0 estados truncados · 64 rejeições incorretas · 370 aceitações incorretas 82.0%IC de 95% 80.8–83.1%
- Laya · nativa1,425/4,490 corretas · 0 erros · 0 estados truncados · 0 rejeições incorretas · 942 aceitações incorretas 31.7%IC de 95% 30.3–33.2%
- Laya · expandida1,017/4,490 corretas · 0 erros · 0 estados truncados · 0 rejeições incorretas · 942 aceitações incorretas 22.7%IC de 95% 21.4–23.9%
- OpenJev · DeBERTa2,496/4,490 corretas · 0 erros · 0 estados truncados · 5 rejeições incorretas · 939 aceitações incorretas 55.6%IC de 95% 54.1–57.0%
- Kev-0.8B2,298/4,490 corretas · 0 erros · 0 estados truncados · 1 rejeições incorretas · 937 aceitações incorretas 51.2%IC de 95% 49.6–52.6%
Aqui Reflex-1 designa os pesos de desenvolvimento de 3 de outubro, não o download padrão nem uma versão final. 4,490 solicitações reservadas: 3,548 intenções conhecidas e 942 fora do escopo. São mostrados Laya nativo e seu controle de contexto ampliado declarado separadamente. Limites de tokens: Reflex-1: estado 1,024, solicitação 4,096; Laya · nativo: solicitação 512, instrução/opções 192; Laya · ampliado: solicitação 2,048, instrução/opções 1,536; OpenJev · DeBERTa: estado 256, solicitação 512; Kev-0.8B: estado 512, ramo incluindo estado 2,048. Encurtamentos de instruções/opções em toda a coorte (não somáveis entre gráficos): Laya · nativo 4,490/4,490; Laya · ampliado 0/4,490. Essas contagens são separadas dos estados truncados acima.
Seleção entre ferramentas desconhecidas
3 de outubro de 2026 · versão de desenvolvimento 70a843878214Seleção de ferramentas
- Reflex-172/87 corretas · 0 erros · 0 estados truncados 82.8%IC de 95% 74.7–90.8%
- Laya · nativa80/87 corretas · 0 erros · 14 estados truncados 92.0%IC de 95% 86.2–97.7%
- Laya · expandida80/87 corretas · 0 erros · 0 estados truncados 92.0%IC de 95% 86.2–97.7%
- OpenJev · DeBERTa82/87 corretas · 0 erros · 30 estados truncados 94.3%IC de 95% 88.5–98.9%
- Kev-0.8B81/87 corretas · 0 erros · 1 estados truncados 93.1%IC de 95% 87.4–97.7%
Aqui Reflex-1 designa os pesos de desenvolvimento de 3 de outubro, não o download padrão nem uma versão final. 87 solicitações reservadas, com nomes de ferramentas e estados normalizados separados antes do treinamento. É uma adaptação de escolha de ferramentas; gerar argumentos e executar está fora do escopo. Limites de tokens: Reflex-1: estado 1,024, solicitação 4,096; Laya · nativo: solicitação 512, instrução/opções 192; Laya · ampliado: solicitação 2,048, instrução/opções 1,536; OpenJev · DeBERTa: estado 256, solicitação 512; Kev-0.8B: estado 512, ramo incluindo estado 2,048. Encurtamentos de instruções/opções em toda a coorte (não somáveis entre gráficos): Laya · nativo 87/87; Laya · ampliado 65/87. Essas contagens são separadas dos estados truncados acima.
São adaptações a opções comuns com coortes declaradas, não submissões a rankings oficiais. Os modelos externos foram avaliados como distribuídos, sem o treinamento específico do Reflex-1. As figuras preservam os intervalos de incerteza, orçamentos de tokens e contagens de truncamento originais.
Velocidade e recursos
As medições desta seção descrevem o checkpoint de 2 de outubro. As medições do checkpoint atual estão disponíveis na ficha do modelo vinculada acima.
latência de solicitação do H200
Reproduzimos 120 solicitações distintas duas vezes por modelo em um NVIDIA H200 compartilhado. Eles vieram de cinco ambientes de jogos e navegadores. Cada modelo recebeu as mesmas informações, com uma solicitação em andamento por vez.
latência de solicitação do H200
120 entradas · duas repetições · uma solicitação em voo- Reflex-1FP32 27.5 / 30.5
- OpenJevFP32 32.0 / 33.8
- Laya (nativa)BF16 27.1 / 142.0
- Laya (repetição de FP32)FP32 40.2 / 44.4
Ponto: mediana. Fim da linha: p95. Inclui tokenização, pontuação e loopback HTTP; exclui carregamento e aquecimento.
Tabela de medição e protocolo completos
| modelo | Recursos computacionais | Mediana | p95 |
|---|---|---|---|
| reflex-1 | FP32 | 27.5 | 30.5 |
| OpenJev | FP32 | 32.0 | 33.8 |
| Laya (nativa) | BF16 | 27.1 | 142.0 |
| Laya (repetição de FP32) | FP32 | 40.2 | 44.4 |
O Laya native usa o autocast BF16; um replay de FP32 separado também está incluído. OpenJev é o checkpoint público de DeBerta, não o Jev hospedado. Esses tempos de solicitação não medem o sucesso da tarefa ou a taxa de transferência simultânea. Gravado em 2026-09-29.
A mediana do reflex-1 foi de 27.5 ms e o p95 de 30.5 ms. Ele foi mais rápido que OpenJev em FP32 e que Laya na medição separada em FP32. A configuração nativa de Laya usou autocast BF16 e teve uma mediana ligeiramente menor. A máquina compartilhada e o tamanho da amostra limitam as conclusões sobre resultados próximos.
O cronômetro inclui tokenização, pontuação do modelo, normalização de saída e HTTP de loopback. Isso exclui o carregamento e três solicitações de aquecimento. Os caches de respostas e opções foram desativados. Não medimos a taxa de transferência simultânea de serviços nesta execução. O OpenJev aqui é o checkpoint público do DeBerta; não é o serviço Jev hospedado.
latência DE CPU M4
O teste de CPU usou um MacBook Air M4, FP32 e tamanho de lote um. Cada modelo usou um thread intra-op PyTorch, um thread inter-op e um limite de thread BLAS de um. Cada tarefa teve 24 casos distintos, cada um repetido duas vezes. A ordem do modelo foi balanceada em oito blocos de execução.
latência de solicitação de CPU M4
FP32 · lote um · threads PyTorch 1/1 · limite BLAS 1Banking77
- Reflex-1 345.2 / 692.0
- OpenJev 1,332.6 / 2,857.1
- Laya 912.4 / 2,649.9
- Kev 4,283.4 / 11,073.7
Emotion
- Reflex-1 256.2 / 610.4
- OpenJev 381.8 / 1,029.5
- Laya 240.1 / 427.7
- Kev 1,121.9 / 4,422.3
AG News
- Reflex-1 321.7 / 578.7
- OpenJev 424.5 / 934.0
- Laya 324.1 / 760.5
- Kev 1,356.5 / 4,997.2
SST-5
- Reflex-1 299.1 / 631.0
- OpenJev 360.5 / 894.5
- Laya 250.7 / 548.5
- Kev 902.2 / 4,480.5
BoolQ
- Reflex-1 463.4 / 1,329.1
- OpenJev 451.9 / 1,398.9
- Laya 440.4 / 1,587.9
- Kev 1,775.3 / 6,548.0
Ponto: mediana. Extremidade da linha: p95. Todas as tarefas usam a mesma escala logarítmica. Memória: RSS máximo do processo de 1.50 GiB em uma medição separada do Reflex-1; a memória de cada modelo não foi medida nesta comparação.
Tabela de medição e protocolo completos
| Tarefa | reflex-1 | OpenJev | Laya | Kev |
|---|---|---|---|---|
| Banking77 | 345.2/ 692.0 | 1332.6/ 2857.1 | 912.4/ 2649.9 | 4283.4/ 11073.7 |
| Emotion | 256.2/ 610.4 | 381.8/ 1029.5 | 240.1/ 427.7 | 1121.9/ 4422.3 |
| AG News | 321.7/ 578.7 | 424.5/ 934.0 | 324.1/ 760.5 | 1356.5/ 4997.2 |
| SST-5 | 299.1/ 631.0 | 360.5/ 894.5 | 250.7/ 548.5 | 902.2/ 4480.5 |
| BoolQ | 463.4/ 1329.1 | 451.9/ 1398.9 | 440.4/ 1587.9 | 1775.3/ 6548.0 |
Orçamentos de tempo de execução nativos. Laya trunca as opções do Banking77 de acordo com seu orçamento nativo; os resultados do orçamento expandido são relatados separadamente. Kev usa seus kernels de referência de CPU e adaptadores não mesclados. Gravado em 2026-09-24.
Memória medida Reflex-1: RSS de processo de pico de 1.50 GiB. Reprodução separada do recurso Reflex-1 das 120 entradas originais, cada uma pontuada duas vezes. O pico de RSS de todo o processo inclui importações, carregamento de modelos, aquecimento e inferência. A comparação original de latência de quatro modelos não registrou memória por modelo. Gravado em 2026-10-02 UTC. Medições e protocolo de recursos.
Banking77 exige escolher entre 77 intenções. A mediana do reflex-1 foi de 345.2 ms, contra 1,332.6 ms do OpenJev na mesma execução. Nas cinco tarefas, as medianas do reflex-1 variaram de 256.2 a 463.4 ms.
Laya foi mais rápida em várias tarefas de menor escolha. Seu orçamento nativo do Banking77 truncou as opções, então seu cronograma cobre um conjunto reduzido de candidatos. Kev usou kernels de referência de CPU com adaptadores não mesclados. A atividade em segundo plano do laptop contribuiu para as maiores latências traseiras.
Este teste mede desde a construção da solicitação até a saída normalizada, com o modelo já carregado. Os testes de CPU e GPU usam solicitações diferentes; seus tempos não permitem calcular diretamente o ganho de velocidade da GPU em relação à CPU.
Precisão em tarefas conhecidas
O reflex-1 obteve uma pontuação de 95.0% no Banking77 e 92.2% no Emotion. Ele liderou os pontos de verificação comparados em ambos, empatou a melhor pontuação na AG News e no SST-5 e teve uma pontuação um pouco abaixo do OpenJev no BoolQ.
Precisão de decisão
500 exemplos por tarefa · diagnósticos de desenvolvimentoBanking77
- Reflex-1 95.0%
- OpenJev 90.6%
- Laya · nativa 44.4%
- Laya · expandida 55.4%
- Kev 82.4%
Emotion
- Reflex-1 92.2%
- OpenJev 53.0%
- Laya · nativa 57.6%
- Laya · expandida 57.6%
- Kev 54.4%
AG News
- Reflex-1 91.2%
- OpenJev 77.4%
- Laya · nativa 91.2%
- Laya · expandida 91.2%
- Kev 87.2%
SST-5
- Reflex-1 59.8%
- OpenJev 59.8%
- Laya · nativa 51.0%
- Laya · expandida 51.0%
- Kev 55.2%
BoolQ
- Reflex-1 86.0%
- OpenJev 86.8%
- Laya · nativa 71.2%
- Laya · expandida 71.2%
- Kev 82.6%
As famílias de tarefas foram incluídas no treinamento e esses subconjuntos foram inspecionados durante o desenvolvimento. A exposição ao treinamento difere entre os modelos. O orçamento nativo de Laya trunca as opções do Banking77.
Tabela de medição e protocolo completos
| Tarefa | reflex-1 | Laya, nativa | Laya, expandida | OpenJev | Kev |
|---|---|---|---|---|---|
| Banking77 | 95.0 | 44.4 | 55.4 | 90.6 | 82.4 |
| Emotion | 92.2 | 57.6 | 57.6 | 53.0 | 54.4 |
| AG News | 91.2 | 91.2 | 91.2 | 77.4 | 87.2 |
| SST-5 | 59.8 | 51.0 | 51.0 | 59.8 | 55.2 |
| BoolQ | 86.0 | 71.2 | 71.2 | 86.8 | 82.6 |
O Laya SDK 0.3.20 é mostrado com orçamentos de tokens nativos e expandidos. O orçamento nativo do Banking77 trunca o conjunto de opções; o orçamento expandido retém todos os 77 rótulos. Esses são diagnósticos de desenvolvimento, não avaliações de transferência independentes.
Foram 500 exemplos de diagnósticos por tarefa. As famílias de tarefas foram incluídas no treinamento e inspecionamos os subconjuntos durante o desenvolvimento. Os orçamentos de treinamento e a exposição anterior diferem entre os modelos. A precisão foi medida separadamente da latência, em mais exemplos.
O checkpoint geral concluiu 0 dos 80 testes com nosso controlador de navegador personalizado. O resultado expõe uma lacuna substancial entre a classificação de tarefas familiares e o controle autônomo. A transferência para perguntas desconhecidas e a calibração de probabilidade permanecem como problemas de avaliação abertos.
Treinamento e armazenamento
O modelo de serviço tem 420,778,370 parâmetros após a fusão dos adaptadores. O ModernBERT codifica o estado e as perguntas; um codificador MiniLM congelado representa as opções. A cabeça compartilhada combina suas representações.
| Recurso | Configuração gravada |
|---|---|
| Parâmetros de serviço | 420,778,370 |
| Parâmetros treinados em adaptação | 9,036,290 |
| Hardware de adaptação | 1 × NVIDIA H200 |
| Corrida principal | 6,000 atualizações · 75 min 7 seg |
| Modelo FP32 extraído no disco | ≈ 1.69 GB |
| Memória de processo medida da CPU | RSS de pico de 1.50 GiB · reprodução separada de 240 solicitações |
| Threads de computação da CPU | PyTorch intra-op/inter-op 1/1 · Limite 1 de BLAS |
A principal execução de adaptação atualizou 9,036,290 parâmetros em 6,000 etapas, usando 290,657 registros de oito famílias de tarefas. Foram necessários 75 minutos e 7 segundos em um H200, incluindo telas de desenvolvimento e salvamentos de checkpoint. O pré-treinamento do modelo básico, a preparação de dados, o ajuste da projeção e os experimentos anteriores são custos adicionais.
O modelo FP32 extraído ocupa cerca de 1.69 GB em disco. A medição separada de recursos de CPU registrou 1.50 GiB de RSS máximo do processo, incluindo alocações do framework, tokenizadores, carregamento, aquecimento e inferência. O uso de memória de GPU ainda não foi medido.
Acesso ao modelo
A versão pública Hugging Face contém os pesos FP32 de 1.68 GB, ambos tokenizadores e uma implementação independente de Transformers no Apache 2.0. Nenhuma conta, chave de API ou acesso ao GitHub é necessário. Use o Python 3.12:
python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0"
import torch
from transformers import AutoModel
torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)
decision = model.predict(
state="The customer was charged twice for one card payment.",
question="Choose the matching issue.",
options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)
Carregue o modelo uma vez e reutilize-o. O cartão modelo documenta inferência em lote, várias perguntas, carregamento offline e hashes de lançamento. O repositório de desenvolvimento permanece privado; o pacote público inclui o código necessário para a inferência.
O treinamento original utilizou RACE e SciQ, cujos termos incluem restrições não comerciais. A ficha do modelo documenta o uso e as revisões fixas. A análise de procedência não determina como esses termos se aplicam aos pesos treinados.
Gravações e reprodução dos resultados
Use a revisão fixa do Hub de 3 de outubro para reproduzir estas gravações. Os gráficos preservam os resultados medidos, incluindo perdas de capacidades anteriores. Cada gravação identifica o ambiente, o formato de entrada e a velocidade de reprodução.
A versão atual tem uma avaliação separada, acessível pela ficha do modelo. Estas gravações e estudos preservam seus resultados originais.
Também em pesquisa
Samsara-VLA
Duas políticas robóticas compactas para manipulação guiada por linguagem. Veja como pegam, colocam, abrem e concluem tarefas de várias etapas.
VIO-lens-2
Pesquisa em andamento.
Correspondência
Escreva para nós
Entre em contato conosco sobre avaliações, acesso a modelos ou colaboração de pesquisa.