Modelos de decisão
Apresentando o Reflex-1
Um modelo de 421M parâmetros para selecionar ferramentas, classificar intenções e escolher ações, com pesos públicos e desempenho medido em CPU.
Um passe, muitas decisões possíveis
O Reflex-1 é um modelo com 421M de parâmetros para decisões que se resolvem com uma escolha. Forneça um estado em texto, uma pergunta e respostas candidatas; ele as pontua em uma única passagem direta. As candidatas podem mudar a cada solicitação.
A mesma interface permite encaminhar solicitações de suporte, selecionar ferramentas ou escolher ações. Um codificador de contexto com 28 camadas e outro de candidatos com seis camadas alimentam uma camada de pontuação compartilhada. A aplicação fornece as opções e executa o resultado.
Reflex-1/ Modelo de decisão
De uma pergunta a uma escolha.
01 / Fornecer
Defina a decisão.
Seu aplicativo fornece o estado, uma pergunta e as opções sobre as quais ela pode agir. Essas opções podem mudar a cada solicitação: filas de suporte, ferramentas disponíveis ou ações permitidas.
Estado + pergunta
O cliente foi cobrado duas vezes.
Qual problema corresponde?Contexto + perguntaModernBERTCada escolhaMiniLMCabeça de pontuação compartilhadaProbabilidades de escolhaAplicaçãoPermissão → argumentos → açãoSolicitação de suporte ilustrativa. O aplicativo define o conjunto de candidatos. 02 / Codificar
Represente o contexto e os candidatos.
Um codificador ModernBERT adaptado lê o estado e a pergunta. Um codificador MiniLM congelado representa cada opção fornecida. Várias perguntas podem compartilhar um estado lotado.
Estado + pergunta
O cliente foi cobrado duas vezes.
Qual problema corresponde?Contexto + perguntaModernBERTCada escolhaMiniLMCabeça de pontuação compartilhadaProbabilidades de escolhaAplicaçãoPermissão → argumentos → açãoDois codificadores alimentam uma cabeça de pontuação compartilhada. Esse é um esquema da arquitetura de pré-visualização. 03 / Pontuar
Marque todas as opções fornecidas em um passe.
A cabeça compartilhada combina o contexto e as representações dos candidatos e, em seguida, retorna uma distribuição de probabilidade sobre as opções fornecidas. Novos tipos de decisão ainda precisam de testes de precisão e calibração.
Estado + pergunta
O cliente foi cobrado duas vezes.
Qual problema corresponde?Contexto + perguntaModernBERTCada escolhaMiniLMCabeça de pontuação compartilhadaProbabilidades de escolhaAplicaçãoPermissão → argumentos → açãoUma pontuação por candidato fornecido, normalizada para uma distribuição de probabilidade. 04 / Agir
Deixe que o aplicativo execute a decisão.
O aplicativo decide quais ações são permitidas, constrói quaisquer argumentos da ferramenta e executa a ação selecionada. O Reflex-1 fornece as pontuações; o sistema circundante possui o circuito de controle.
Estado + pergunta
O cliente foi cobrado duas vezes.
Qual problema corresponde?Contexto + perguntaModernBERTCada escolhaMiniLMCabeça de pontuação compartilhadaProbabilidades de escolhaAplicaçãoPermissão → argumentos → açãoO limite do aplicativo é importante: pontuar uma ferramenta não a executa.
Arquitetura da prévia do desenvolvimento público. A solicitação de suporte ilustra o formato de entrada.
Exemplos gravados
A gravação de Dino acima e os exemplos abaixo usam a versão de 3 de outubro, diferente dos pesos públicos padrão. As condições de execução e os resultados aparecem nas descrições dos vídeos.
Ver todas as gravações e comparações.
Inferência em CPU
O checkpoint atual foi medido em uma CPU Intel Xeon Platinum 8558 em FP32, com uma solicitação por vez. Cada configuração de threads abrange 480 chamadas sobre 120 entradas em dois novos processos. Os tempos incluem tokenização e inferência.
Medições atuais em CPU
Intel Xeon Platinum 8558 · FP32 · lote de 1Uma thread de computação
- AG News 1209.7 / 1385.0 ms
- SST-5 973.6 / 1160.3 ms
- Emotion 956.9 / 1165.8 ms
- Banking77 1101.7 / 1276.9 ms
- BoolQ 1600.8 / 2710.6 ms
Quatro threads de computação
- AG News 389.5 / 480.4 ms
- SST-5 320.6 / 404.2 ms
- Emotion 318.8 / 391.0 ms
- Banking77 375.2 / 452.1 ms
- BoolQ 486.7 / 782.2 ms
480 chamadas por configuração de threads sobre 120 entradas em dois processos novos. Inclui tokenização e inferência; exclui carregamento e aquecimento. Host compartilhado, ambiente de avaliação e sem cache entre solicitações.
O pico de memória do processo foi de 2.17 GiB, incluindo carregamento, aquecimento e inferência. As execuções usaram uma ou quatro threads intraoperação do PyTorch, uma thread entre operações e limites correspondentes de BLAS. Foram observadas duas e onze threads totais do sistema operacional, respectivamente, incluindo as auxiliares do ambiente de execução.
Medições e avaliação atuais. Esses tempos em host compartilhado usam o ambiente de avaliação. Carregamento, aquecimento e cache entre solicitações são excluídos. A página de pesquisa mantém as medições anteriores de M4 e H200 com as datas dos checkpoints.
Experimente o Reflex-1
Os pesos públicos, os tokenizadores e o código de inferência estão disponíveis no Hugging Face. Não é necessário ter uma conta ou chave de API. Após instalar as dependências:
import torch
from transformers import AutoModel
torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)
decision = model.predict(
state="The customer was charged twice for one card payment.",
question="Choose the matching issue.",
options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)
Consulte o cartão do modelo para saber sobre instalação, limites de execução e licenciamento, incluindo os termos das fontes de treinamento.
DETALHES DO MODELO
Reflex-1
Um modelo de 421M parâmetros para selecionar ferramentas, classificar intenções e escolher ações. Pesos públicos; execução em CPU ou GPU.