Modelos de decisión
Presentamos Reflex-1
Un modelo de 421M parámetros para seleccionar herramientas, clasificar intenciones y elegir acciones, con pesos públicos y rendimiento medido en CPU.
Un pase, muchas decisiones posibles
Reflex-1 es un modelo de 421M parámetros para decisiones que se resuelven con una elección. Recibe un estado en texto, una pregunta y respuestas candidatas, y las puntúa en una sola pasada hacia adelante. Las candidatas pueden cambiar en cada solicitud.
La misma interfaz permite dirigir solicitudes de soporte, seleccionar herramientas o elegir acciones. Un codificador de contexto de 28 capas y otro de candidatos de seis capas alimentan un cabezal de puntuación compartido. La aplicación proporciona las opciones y ejecuta el resultado.
Reflex-1//Modelo de decisión
De una pregunta a una elección.
01 / Proporcionar
Defina la decisión.
Su solicitud proporciona al estado una pregunta y las opciones sobre las que puede tomar medidas. Estas opciones pueden cambiar con cada solicitud: colas de soporte, herramientas disponibles o acciones permitidas.
Estado + pregunta
Al cliente se le cobró dos veces.
¿Qué número coincide?Contexto + preguntaModernBERTCada elecciónMiniLMCabezal anotador compartidoProbabilidades de elecciónSolicitudPermiso → argumentos → acciónSolicitud de soporte ilustrativa. La aplicación define el conjunto de candidatos. 02 / Codificar
Representa el contexto y a los candidatos.
Un codificador ModernBERT adaptado lee el estado y la pregunta. Un codificador MiniLM congelado representa cada opción suministrada. Varias preguntas pueden compartir un estado repleto.
Estado + pregunta
Al cliente se le cobró dos veces.
¿Qué número coincide?Contexto + preguntaModernBERTCada elecciónMiniLMCabezal anotador compartidoProbabilidades de elecciónSolicitudPermiso → argumentos → acciónDos codificadores alimentan un cabezal de puntuación compartido. Este es un esquema de la arquitectura de vista previa. 03 / Puntuar
Anota todas las opciones ofrecidas en un solo pase.
El encabezado compartido combina las representaciones del contexto y de los candidatos y, a continuación, devuelve una distribución de probabilidad sobre las opciones proporcionadas. Los nuevos tipos de decisión aún necesitan pruebas de precisión y calibración.
Estado + pregunta
Al cliente se le cobró dos veces.
¿Qué número coincide?Contexto + preguntaModernBERTCada elecciónMiniLMCabezal anotador compartidoProbabilidades de elecciónSolicitudPermiso → argumentos → acciónUna puntuación por candidato suministrado, normalizada a una distribución de probabilidad. 04 / Actuar
Deje que la aplicación lleve a cabo la decisión.
La aplicación decide qué acciones están permitidas, construye los argumentos de la herramienta y ejecuta la acción seleccionada. Reflex-1 proporciona las puntuaciones; el sistema circundante es el propietario del circuito de control.
Estado + pregunta
Al cliente se le cobró dos veces.
¿Qué número coincide?Contexto + preguntaModernBERTCada elecciónMiniLMCabezal anotador compartidoProbabilidades de elecciónSolicitudPermiso → argumentos → acciónEl límite de la aplicación es importante: puntuar una herramienta no la ejecuta.
Vista previa de la arquitectura del desarrollo público. La solicitud de soporte ilustra el formato de entrada.
Ejemplos grabados
La grabación de Dino que aparece arriba y los ejemplos siguientes usan la versión del 3 de octubre, que difiere de los pesos públicos predeterminados. Las condiciones de ejecución y los resultados figuran en las descripciones de los vídeos.
Ver todas las grabaciones y comparaciones.
Inferencia en CPU
El checkpoint actual se midió en una CPU Intel Xeon Platinum 8558 en FP32, con una solicitud a la vez. Cada configuración de hilos abarca 480 llamadas sobre 120 entradas en dos procesos nuevos. Los tiempos incluyen la tokenización y la inferencia.
Mediciones actuales en CPU
Intel Xeon Platinum 8558 · FP32 · lote de 1Un hilo de cómputo
- AG News 1209.7 / 1385.0 ms
- SST-5 973.6 / 1160.3 ms
- Emotion 956.9 / 1165.8 ms
- Banking77 1101.7 / 1276.9 ms
- BoolQ 1600.8 / 2710.6 ms
Cuatro hilos de cómputo
- AG News 389.5 / 480.4 ms
- SST-5 320.6 / 404.2 ms
- Emotion 318.8 / 391.0 ms
- Banking77 375.2 / 452.1 ms
- BoolQ 486.7 / 782.2 ms
480 llamadas por configuración de hilos sobre 120 entradas en dos procesos nuevos. Incluye tokenización e inferencia; excluye carga y calentamiento. Host compartido, entorno de evaluación y sin caché entre solicitudes.
El pico de memoria del proceso fue de 2.17 GiB, incluida la carga, el calentamiento y la inferencia. Las pruebas usaron uno o cuatro hilos intraoperación de PyTorch, un hilo entre operaciones y límites de BLAS equivalentes. Se observaron dos y once hilos totales del sistema operativo, respectivamente, incluidos los auxiliares del entorno de ejecución.
Mediciones y evaluación actuales. Estos tiempos en host compartido usan el entorno de evaluación. Se excluyen carga, calentamiento y caché entre solicitudes. La página de investigación conserva las mediciones anteriores de M4 y H200 con las fechas de sus checkpoints.
Probar Reflex-1
Los pesos públicos, los tokenizadores y el código de inferencia están disponibles en Hugging Face. No se necesita una cuenta ni una clave de API. Una vez instaladas las dependencias:
import torch
from transformers import AutoModel
torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)
decision = model.predict(
state="The customer was charged twice for one card payment.",
question="Choose the matching issue.",
options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)
Consulta la ficha del modelo para conocer la instalación, los límites de ejecución y la licencia, incluidas las condiciones de las fuentes de entrenamiento.
DETALLES DEL MODELO
Reflex-1
Un modelo de 421M parámetros para seleccionar herramientas, clasificar intenciones y elegir acciones. Pesos públicos; se ejecuta en CPU o GPU.