[↖ Publicaciones](https://www.goodailabs.com/es/blog/) ANUNCIO 5 de octubre de 2026 Modelos de decisión # Presentamos Reflex-1 Un modelo de 421M parámetros para seleccionar herramientas, clasificar intenciones y elegir acciones, con pesos públicos y rendimiento medido en CPU. Good AI Labs: lectura de · 5 minutos [Modelo y evaluación ↗](https://www.goodailabs.com/es/research/reflex-1/) [Pesos y código ↗](https://huggingface.co/gai-labs/reflex-1)[Resultados de la versión ↗](https://www.goodailabs.com/es/research/reflex-1/#current-results) Reflex-1 · Chromium original43.6 s · VÍDEO MUDO [Ver Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-002-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 en Chromium Dino nativo, con geometría visible estructurada del motor. Versión del 3 de octubre de 2026. La grabación completa de un recorrido independiente termina en colisión a los 42.309 segundos (puntuación 535); no completa los 60 segundos. El navegador sigue durante la inferencia. Grabación del navegador a velocidad normal; el reloj del juego sigue durante la inferencia. EN ESTE ARTÍCULO[El modelo](https://www.goodailabs.com/#one-pass-many-possible-decisions)[Ejemplos](https://www.goodailabs.com/#recorded-examples)[Inferencia en CPU](https://www.goodailabs.com/#cpu-inference)[Probar Reflex-1](https://www.goodailabs.com/#try-reflex-1) ## Un pase, muchas decisiones posibles Reflex-1 es un modelo de 421M parámetros para decisiones que se resuelven con una elección. Recibe un estado en texto, una pregunta y respuestas candidatas, y las puntúa en una sola pasada hacia adelante. Las candidatas pueden cambiar en cada solicitud. La misma interfaz permite dirigir solicitudes de soporte, seleccionar herramientas o elegir acciones. Un codificador de contexto de 28 capas y otro de candidatos de seis capas alimentan un cabezal de puntuación compartido. La aplicación proporciona las opciones y ejecuta el resultado. Reflex-1//Modelo de decisión ### De una pregunta a una elección. - 01 / Proporcionar #### Defina la decisión. Su solicitud proporciona al estado una pregunta y las opciones sobre las que puede tomar medidas. Estas opciones pueden cambiar con cada solicitud: colas de soporte, herramientas disponibles o acciones permitidas. Estado + pregunta Al cliente se le cobró dos veces. ¿Qué número coincide? Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo ↓ Contexto + preguntaModernBERT Cada elecciónMiniLM ↓ Cabezal anotador compartidoProbabilidades de elección ↓ SolicitudPermiso → argumentos → acción Solicitud de soporte ilustrativa. La aplicación define el conjunto de candidatos. - 02 / Codificar #### Representa el contexto y a los candidatos. Un codificador ModernBERT adaptado lee el estado y la pregunta. Un codificador MiniLM congelado representa cada opción suministrada. Varias preguntas pueden compartir un estado repleto. Estado + pregunta Al cliente se le cobró dos veces. ¿Qué número coincide? Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo ↓ Contexto + preguntaModernBERT Cada elecciónMiniLM ↓ Cabezal anotador compartidoProbabilidades de elección ↓ SolicitudPermiso → argumentos → acción Dos codificadores alimentan un cabezal de puntuación compartido. Este es un esquema de la arquitectura de vista previa. - 03 / Puntuar #### Anota todas las opciones ofrecidas en un solo pase. El encabezado compartido combina las representaciones del contexto y de los candidatos y, a continuación, devuelve una distribución de probabilidad sobre las opciones proporcionadas. Los nuevos tipos de decisión aún necesitan pruebas de precisión y calibración. Estado + pregunta Al cliente se le cobró dos veces. ¿Qué número coincide? Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo ↓ Contexto + preguntaModernBERT Cada elecciónMiniLM ↓ Cabezal anotador compartidoProbabilidades de elección ↓ SolicitudPermiso → argumentos → acción Una puntuación por candidato suministrado, normalizada a una distribución de probabilidad. - 04 / Actuar #### Deje que la aplicación lleve a cabo la decisión. La aplicación decide qué acciones están permitidas, construye los argumentos de la herramienta y ejecuta la acción seleccionada. Reflex-1 proporciona las puntuaciones; el sistema circundante es el propietario del circuito de control. Estado + pregunta Al cliente se le cobró dos veces. ¿Qué número coincide? Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo ↓ Contexto + preguntaModernBERT Cada elecciónMiniLM ↓ Cabezal anotador compartidoProbabilidades de elección ↓ SolicitudPermiso → argumentos → acción El límite de la aplicación es importante: puntuar una herramienta no la ejecuta. Vista previa de la arquitectura del desarrollo público. La solicitud de soporte ilustra el formato de entrada. ## Ejemplos grabados La grabación de Dino que aparece arriba y los ejemplos siguientes usan la [versión del 3 de octubre](https://huggingface.co/gai-labs/reflex-1/tree/ae50bf81cddcaaac2aa18021d862433ca69da197), que difiere de los pesos públicos predeterminados. Las condiciones de ejecución y los resultados figuran en las descripciones de los vídeos. Reflex-1 · ViZDoom nativo36.5 s · VÍDEO MUDO [Ver Reflex-1 · ViZDoom (MP4)](https://www.goodailabs.com/media/reflex-1/preview/vizdoom-510001-clean.mp4). Reflex-1 · ViZDoom. Reflex-1 en ViZDoom 1.3.1 nativo, Defend the Center, dificultad 5. Versión del 3 de octubre de 2026; semilla de grabación declarada: 510001. El episodio completo termina en muerte a los 34.514 de los 45 segundos de simulación permitidos, con 30 bajas. Recibe etiquetas visibles del motor y salud/munición, no píxeles. La reproducción sigue el tiempo de simulación y excluye demoras de inferencia. La reproducción sigue el tiempo de simulación, sin demoras de inferencia; se conserva la pausa final original. Reflex-1 · WebGym sintético30.1 s · 4× · VÍDEO MUDO [Ver Reserva de restaurante · tarea completada (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-restaurant-960000-clean.mp4). Reserva de restaurante · tarea completada. Versión de desarrollo del 3 de octubre; 15 acciones. Estados capturados en Chromium y reproducidos a 4× el tiempo real, con desenlace y pausa final completos. Tarea sintética local con un auxiliar de texto Qwen3-1.7B compartido. Esta versión difiere de los pesos predeterminados del Hub. [Ver todas las grabaciones y comparaciones](https://www.goodailabs.com/es/research/reflex-1/#examples). ## Inferencia en CPU El checkpoint actual se midió en una CPU Intel Xeon Platinum 8558 en FP32, con una solicitud a la vez. Cada configuración de hilos abarca 480 llamadas sobre 120 entradas en dos procesos nuevos. Los tiempos incluyen la tokenización y la inferencia. Mediciones actuales en CPU Intel Xeon Platinum 8558 · FP32 · lote de 1 Un hilo de cómputo Latencia · menor es más rápidoMediana//p95 - AG News 1209.7 / 1385.0 ms - SST-5 973.6 / 1160.3 ms - Emotion 956.9 / 1165.8 ms - Banking77 1101.7 / 1276.9 ms - BoolQ 1600.8 / 2710.6 ms 01,5003,000 ms Cuatro hilos de cómputo Latencia · menor es más rápidoMediana//p95 - AG News 389.5 / 480.4 ms - SST-5 320.6 / 404.2 ms - Emotion 318.8 / 391.0 ms - Banking77 375.2 / 452.1 ms - BoolQ 486.7 / 782.2 ms 01,5003,000 ms 480 llamadas por configuración de hilos sobre 120 entradas en dos procesos nuevos. Incluye tokenización e inferencia; excluye carga y calentamiento. Host compartido, entorno de evaluación y sin caché entre solicitudes. El pico de memoria del proceso fue de 2.17 GiB, incluida la carga, el calentamiento y la inferencia. Las pruebas usaron uno o cuatro hilos intraoperación de PyTorch, un hilo entre operaciones y límites de BLAS equivalentes. Se observaron dos y once hilos totales del sistema operativo, respectivamente, incluidos los auxiliares del entorno de ejecución. [Mediciones y evaluación actuales](https://huggingface.co/gai-labs/reflex-1/blob/84c2cd49d31f73544e1e17539092056e741e7f03/evaluation.json). Estos tiempos en host compartido usan el entorno de evaluación. Se excluyen carga, calentamiento y caché entre solicitudes. La página de investigación conserva las [mediciones anteriores de M4 y H200](https://www.goodailabs.com/es/research/reflex-1/#speed-and-resources) con las fechas de sus checkpoints. ## Probar Reflex-1 Los pesos públicos, los tokenizadores y el código de inferencia están disponibles en [Hugging Face](https://huggingface.co/gai-labs/reflex-1). No se necesita una cuenta ni una clave de API. Una vez instaladas las dependencias: ``` import torch from transformers import AutoModel torch.set_num_threads(1) model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True) decision = model.predict( state="The customer was charged twice for one card payment.", question="Choose the matching issue.", options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"], )[0] print(decision.choice) ``` Consulta la [ficha del modelo](https://huggingface.co/gai-labs/reflex-1) para conocer la instalación, los límites de ejecución y la licencia, incluidas las condiciones de las fuentes de entrenamiento. [DETALLES DEL MODELO ## Reflex-1 Un modelo de 421M parámetros para seleccionar herramientas, clasificar intenciones y elegir acciones. Pesos públicos; se ejecuta en CPU o GPU. ↗](https://www.goodailabs.com/es/research/reflex-1/) [Más información del laboratorio ↗](https://www.goodailabs.com/es/blog/)