[↖ Publicações](https://www.goodailabs.com/pt/blog/) ANÚNCIO 5 de outubro de 2026 Modelos de decisão # Apresentando o Reflex-1 Um modelo de 421M parâmetros para selecionar ferramentas, classificar intenções e escolher ações, com pesos públicos e desempenho medido em CPU. Good AI Labs · 5 min de leitura [Modelo e avaliação ↗](https://www.goodailabs.com/pt/research/reflex-1/) [Pesos e código ↗](https://huggingface.co/gai-labs/reflex-1)[Resultados da versão ↗](https://www.goodailabs.com/pt/research/reflex-1/#current-results) Reflex-1 · Chromium original43.6 s · VÍDEO SILENCIOSO [Ver Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-002-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 no Chromium Dino nativo, com geometria visível estruturada do motor. Versão de 3 de outubro de 2026. A gravação completa de um percurso independente termina em colisão aos 42.309 segundos (pontuação 535); não completa 60 segundos. O navegador continua durante a inferência. Gravação do navegador em velocidade normal; o relógio do jogo continua durante a inferência. NESTE ARTIGO[O modelo](https://www.goodailabs.com/#one-pass-many-possible-decisions)[Exemplos](https://www.goodailabs.com/#recorded-examples)[Inferência em CPU](https://www.goodailabs.com/#cpu-inference)[Experimente o Reflex-1](https://www.goodailabs.com/#try-reflex-1) ## Um passe, muitas decisões possíveis O Reflex-1 é um modelo com 421M de parâmetros para decisões que se resolvem com uma escolha. Forneça um estado em texto, uma pergunta e respostas candidatas; ele as pontua em uma única passagem direta. As candidatas podem mudar a cada solicitação. A mesma interface permite encaminhar solicitações de suporte, selecionar ferramentas ou escolher ações. Um codificador de contexto com 28 camadas e outro de candidatos com seis camadas alimentam uma camada de pontuação compartilhada. A aplicação fornece as opções e executa o resultado. Reflex-1/ Modelo de decisão ### De uma pergunta a uma escolha. - 01 / Fornecer #### Defina a decisão. Seu aplicativo fornece o estado, uma pergunta e as opções sobre as quais ela pode agir. Essas opções podem mudar a cada solicitação: filas de suporte, ferramentas disponíveis ou ações permitidas. Estado + pergunta O cliente foi cobrado duas vezes. Qual problema corresponde? Cobrança duplicadaCartão perdidoTaxa desconhecidaRetirada de dinheiro ↓ Contexto + perguntaModernBERT Cada escolhaMiniLM ↓ Cabeça de pontuação compartilhadaProbabilidades de escolha ↓ AplicaçãoPermissão → argumentos → ação Solicitação de suporte ilustrativa. O aplicativo define o conjunto de candidatos. - 02 / Codificar #### Represente o contexto e os candidatos. Um codificador ModernBERT adaptado lê o estado e a pergunta. Um codificador MiniLM congelado representa cada opção fornecida. Várias perguntas podem compartilhar um estado lotado. Estado + pergunta O cliente foi cobrado duas vezes. Qual problema corresponde? Cobrança duplicadaCartão perdidoTaxa desconhecidaRetirada de dinheiro ↓ Contexto + perguntaModernBERT Cada escolhaMiniLM ↓ Cabeça de pontuação compartilhadaProbabilidades de escolha ↓ AplicaçãoPermissão → argumentos → ação Dois codificadores alimentam uma cabeça de pontuação compartilhada. Esse é um esquema da arquitetura de pré-visualização. - 03 / Pontuar #### Marque todas as opções fornecidas em um passe. A cabeça compartilhada combina o contexto e as representações dos candidatos e, em seguida, retorna uma distribuição de probabilidade sobre as opções fornecidas. Novos tipos de decisão ainda precisam de testes de precisão e calibração. Estado + pergunta O cliente foi cobrado duas vezes. Qual problema corresponde? Cobrança duplicadaCartão perdidoTaxa desconhecidaRetirada de dinheiro ↓ Contexto + perguntaModernBERT Cada escolhaMiniLM ↓ Cabeça de pontuação compartilhadaProbabilidades de escolha ↓ AplicaçãoPermissão → argumentos → ação Uma pontuação por candidato fornecido, normalizada para uma distribuição de probabilidade. - 04 / Agir #### Deixe que o aplicativo execute a decisão. O aplicativo decide quais ações são permitidas, constrói quaisquer argumentos da ferramenta e executa a ação selecionada. O Reflex-1 fornece as pontuações; o sistema circundante possui o circuito de controle. Estado + pergunta O cliente foi cobrado duas vezes. Qual problema corresponde? Cobrança duplicadaCartão perdidoTaxa desconhecidaRetirada de dinheiro ↓ Contexto + perguntaModernBERT Cada escolhaMiniLM ↓ Cabeça de pontuação compartilhadaProbabilidades de escolha ↓ AplicaçãoPermissão → argumentos → ação O limite do aplicativo é importante: pontuar uma ferramenta não a executa. Arquitetura da prévia do desenvolvimento público. A solicitação de suporte ilustra o formato de entrada. ## Exemplos gravados A gravação de Dino acima e os exemplos abaixo usam a [versão de 3 de outubro](https://huggingface.co/gai-labs/reflex-1/tree/ae50bf81cddcaaac2aa18021d862433ca69da197), diferente dos pesos públicos padrão. As condições de execução e os resultados aparecem nas descrições dos vídeos. Reflex-1 · ViZDoom nativo36.5 s · VÍDEO SILENCIOSO [Ver Reflex-1 · ViZDoom (MP4)](https://www.goodailabs.com/media/reflex-1/preview/vizdoom-510001-clean.mp4). Reflex-1 · ViZDoom. Reflex-1 no ViZDoom 1.3.1 nativo, Defend the Center, dificuldade 5. Versão de 3 de outubro de 2026; semente de gravação declarada: 510001. O episódio completo termina em morte aos 34.514 dos 45 segundos de simulação permitidos, com 30 eliminações. Recebe rótulos visíveis do motor e vida/munição, não pixels. A reprodução segue o tempo da simulação, sem atrasos de inferência. A reprodução segue o tempo da simulação, sem atrasos de inferência; a pausa final original é preservada. Reflex-1 · WebGym sintético30.1 s · 4× · VÍDEO SILENCIOSO [Ver Reserva de restaurante · tarefa concluída (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-restaurant-960000-clean.mp4). Reserva de restaurante · tarefa concluída. Versão de desenvolvimento de 3 de outubro; 15 ações. Estados capturados no Chromium e reproduzidos a 4× o tempo real, com desfecho e pausa final completos. Tarefa sintética local com auxiliar de texto Qwen3-1.7B compartilhado. Esta versão difere dos pesos padrão do Hub. [Ver todas as gravações e comparações](https://www.goodailabs.com/pt/research/reflex-1/#examples). ## Inferência em CPU O checkpoint atual foi medido em uma CPU Intel Xeon Platinum 8558 em FP32, com uma solicitação por vez. Cada configuração de threads abrange 480 chamadas sobre 120 entradas em dois novos processos. Os tempos incluem tokenização e inferência. Medições atuais em CPU Intel Xeon Platinum 8558 · FP32 · lote de 1 Uma thread de computação Latência · menor é mais rápidoMediana//p95 - AG News 1209.7 / 1385.0 ms - SST-5 973.6 / 1160.3 ms - Emotion 956.9 / 1165.8 ms - Banking77 1101.7 / 1276.9 ms - BoolQ 1600.8 / 2710.6 ms 01,5003,000 ms Quatro threads de computação Latência · menor é mais rápidoMediana//p95 - AG News 389.5 / 480.4 ms - SST-5 320.6 / 404.2 ms - Emotion 318.8 / 391.0 ms - Banking77 375.2 / 452.1 ms - BoolQ 486.7 / 782.2 ms 01,5003,000 ms 480 chamadas por configuração de threads sobre 120 entradas em dois processos novos. Inclui tokenização e inferência; exclui carregamento e aquecimento. Host compartilhado, ambiente de avaliação e sem cache entre solicitações. O pico de memória do processo foi de 2.17 GiB, incluindo carregamento, aquecimento e inferência. As execuções usaram uma ou quatro threads intraoperação do PyTorch, uma thread entre operações e limites correspondentes de BLAS. Foram observadas duas e onze threads totais do sistema operacional, respectivamente, incluindo as auxiliares do ambiente de execução. [Medições e avaliação atuais](https://huggingface.co/gai-labs/reflex-1/blob/84c2cd49d31f73544e1e17539092056e741e7f03/evaluation.json). Esses tempos em host compartilhado usam o ambiente de avaliação. Carregamento, aquecimento e cache entre solicitações são excluídos. A página de pesquisa mantém as [medições anteriores de M4 e H200](https://www.goodailabs.com/pt/research/reflex-1/#speed-and-resources) com as datas dos checkpoints. ## Experimente o Reflex-1 Os pesos públicos, os tokenizadores e o código de inferência estão disponíveis no [Hugging Face](https://huggingface.co/gai-labs/reflex-1). Não é necessário ter uma conta ou chave de API. Após instalar as dependências: ``` import torch from transformers import AutoModel torch.set_num_threads(1) model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True) decision = model.predict( state="The customer was charged twice for one card payment.", question="Choose the matching issue.", options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"], )[0] print(decision.choice) ``` Consulte o [cartão do modelo](https://huggingface.co/gai-labs/reflex-1) para saber sobre instalação, limites de execução e licenciamento, incluindo os termos das fontes de treinamento. [DETALHES DO MODELO ## Reflex-1 Um modelo de 421M parâmetros para selecionar ferramentas, classificar intenções e escolher ações. Pesos públicos; execução em CPU ou GPU. ↗](https://www.goodailabs.com/pt/research/reflex-1/) [Mais do laboratório ↗](https://www.goodailabs.com/pt/blog/)