ES
Contacto
Menú
Publicaciones

ANUNCIO

Modelos de decisión

Presentamos Reflex-1

Un modelo de 421M parámetros para seleccionar herramientas, clasificar intenciones y elegir acciones, con pesos públicos y rendimiento medido en CPU.

Good AI Labs: lectura de 5 minutos

Reflex-1 · Chromium original43.6 s VÍDEO MUDO
Reflex-1 · Chromium Dino. Reflex-1 en Chromium Dino nativo, con geometría visible estructurada del motor. Versión del 3 de octubre de 2026. La grabación completa de un recorrido independiente termina en colisión a los 42.309 segundos (puntuación 535); no completa los 60 segundos. El navegador sigue durante la inferencia. Grabación del navegador a velocidad normal; el reloj del juego sigue durante la inferencia.

Un pase, muchas decisiones posibles

Reflex-1 es un modelo de 421M parámetros para decisiones que se resuelven con una elección. Recibe un estado en texto, una pregunta y respuestas candidatas, y las puntúa en una sola pasada hacia adelante. Las candidatas pueden cambiar en cada solicitud.

La misma interfaz permite dirigir solicitudes de soporte, seleccionar herramientas o elegir acciones. Un codificador de contexto de 28 capas y otro de candidatos de seis capas alimentan un cabezal de puntuación compartido. La aplicación proporciona las opciones y ejecuta el resultado.

Reflex-1//Modelo de decisión

De una pregunta a una elección.

  1. 01 / Proporcionar

    Defina la decisión.

    Su solicitud proporciona al estado una pregunta y las opciones sobre las que puede tomar medidas. Estas opciones pueden cambiar con cada solicitud: colas de soporte, herramientas disponibles o acciones permitidas.

    Estado + pregunta

    Al cliente se le cobró dos veces.
    ¿Qué número coincide?

    Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo
    Contexto + preguntaModernBERT
    Cada elecciónMiniLM
    Cabezal anotador compartidoProbabilidades de elección
    SolicitudPermiso → argumentos → acción
    Solicitud de soporte ilustrativa. La aplicación define el conjunto de candidatos.
  2. 02 / Codificar

    Representa el contexto y a los candidatos.

    Un codificador ModernBERT adaptado lee el estado y la pregunta. Un codificador MiniLM congelado representa cada opción suministrada. Varias preguntas pueden compartir un estado repleto.

    Estado + pregunta

    Al cliente se le cobró dos veces.
    ¿Qué número coincide?

    Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo
    Contexto + preguntaModernBERT
    Cada elecciónMiniLM
    Cabezal anotador compartidoProbabilidades de elección
    SolicitudPermiso → argumentos → acción
    Dos codificadores alimentan un cabezal de puntuación compartido. Este es un esquema de la arquitectura de vista previa.
  3. 03 / Puntuar

    Anota todas las opciones ofrecidas en un solo pase.

    El encabezado compartido combina las representaciones del contexto y de los candidatos y, a continuación, devuelve una distribución de probabilidad sobre las opciones proporcionadas. Los nuevos tipos de decisión aún necesitan pruebas de precisión y calibración.

    Estado + pregunta

    Al cliente se le cobró dos veces.
    ¿Qué número coincide?

    Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo
    Contexto + preguntaModernBERT
    Cada elecciónMiniLM
    Cabezal anotador compartidoProbabilidades de elección
    SolicitudPermiso → argumentos → acción
    Una puntuación por candidato suministrado, normalizada a una distribución de probabilidad.
  4. 04 / Actuar

    Deje que la aplicación lleve a cabo la decisión.

    La aplicación decide qué acciones están permitidas, construye los argumentos de la herramienta y ejecuta la acción seleccionada. Reflex-1 proporciona las puntuaciones; el sistema circundante es el propietario del circuito de control.

    Estado + pregunta

    Al cliente se le cobró dos veces.
    ¿Qué número coincide?

    Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo
    Contexto + preguntaModernBERT
    Cada elecciónMiniLM
    Cabezal anotador compartidoProbabilidades de elección
    SolicitudPermiso → argumentos → acción
    El límite de la aplicación es importante: puntuar una herramienta no la ejecuta.

Vista previa de la arquitectura del desarrollo público. La solicitud de soporte ilustra el formato de entrada.

Ejemplos grabados

La grabación de Dino que aparece arriba y los ejemplos siguientes usan la versión del 3 de octubre, que difiere de los pesos públicos predeterminados. Las condiciones de ejecución y los resultados figuran en las descripciones de los vídeos.

Reflex-1 · ViZDoom nativo36.5 s VÍDEO MUDO
Reflex-1 · ViZDoom. Reflex-1 en ViZDoom 1.3.1 nativo, Defend the Center, dificultad 5. Versión del 3 de octubre de 2026; semilla de grabación declarada: 510001. El episodio completo termina en muerte a los 34.514 de los 45 segundos de simulación permitidos, con 30 bajas. Recibe etiquetas visibles del motor y salud/munición, no píxeles. La reproducción sigue el tiempo de simulación y excluye demoras de inferencia. La reproducción sigue el tiempo de simulación, sin demoras de inferencia; se conserva la pausa final original.
Reflex-1 · WebGym sintético30.1 s · 4× VÍDEO MUDO
Reserva de restaurante · tarea completada. Versión de desarrollo del 3 de octubre; 15 acciones. Estados capturados en Chromium y reproducidos a 4× el tiempo real, con desenlace y pausa final completos. Tarea sintética local con un auxiliar de texto Qwen3-1.7B compartido. Esta versión difiere de los pesos predeterminados del Hub.

Ver todas las grabaciones y comparaciones.

Inferencia en CPU

El checkpoint actual se midió en una CPU Intel Xeon Platinum 8558 en FP32, con una solicitud a la vez. Cada configuración de hilos abarca 480 llamadas sobre 120 entradas en dos procesos nuevos. Los tiempos incluyen la tokenización y la inferencia.

Mediciones actuales en CPU

Intel Xeon Platinum 8558 · FP32 · lote de 1

Un hilo de cómputo

Latencia · menor es más rápidoMediana//p95
  1. AG News 1209.7 / 1385.0 ms
  2. SST-5 973.6 / 1160.3 ms
  3. Emotion 956.9 / 1165.8 ms
  4. Banking77 1101.7 / 1276.9 ms
  5. BoolQ 1600.8 / 2710.6 ms

Cuatro hilos de cómputo

Latencia · menor es más rápidoMediana//p95
  1. AG News 389.5 / 480.4 ms
  2. SST-5 320.6 / 404.2 ms
  3. Emotion 318.8 / 391.0 ms
  4. Banking77 375.2 / 452.1 ms
  5. BoolQ 486.7 / 782.2 ms

480 llamadas por configuración de hilos sobre 120 entradas en dos procesos nuevos. Incluye tokenización e inferencia; excluye carga y calentamiento. Host compartido, entorno de evaluación y sin caché entre solicitudes.

El pico de memoria del proceso fue de 2.17 GiB, incluida la carga, el calentamiento y la inferencia. Las pruebas usaron uno o cuatro hilos intraoperación de PyTorch, un hilo entre operaciones y límites de BLAS equivalentes. Se observaron dos y once hilos totales del sistema operativo, respectivamente, incluidos los auxiliares del entorno de ejecución.

Mediciones y evaluación actuales. Estos tiempos en host compartido usan el entorno de evaluación. Se excluyen carga, calentamiento y caché entre solicitudes. La página de investigación conserva las mediciones anteriores de M4 y H200 con las fechas de sus checkpoints.

Probar Reflex-1

Los pesos públicos, los tokenizadores y el código de inferencia están disponibles en Hugging Face. No se necesita una cuenta ni una clave de API. Una vez instaladas las dependencias:

import torch
from transformers import AutoModel

torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)

decision = model.predict(
    state="The customer was charged twice for one card payment.",
    question="Choose the matching issue.",
    options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)

Consulta la ficha del modelo para conocer la instalación, los límites de ejecución y la licencia, incluidas las condiciones de las fuentes de entrenamiento.

DETALLES DEL MODELO

Reflex-1

Un modelo de 421M parámetros para seleccionar herramientas, clasificar intenciones y elegir acciones. Pesos públicos; se ejecuta en CPU o GPU.