[Investigación](https://www.goodailabs.com/es/research/) Pesos públicos # Reflex-1 Modelos de decisión para agentes Un modelo de decisión de 421M parámetros para agentes. Una sola pasada, en CPU o GPU. Pesos ajustados disponibles en Hugging Face. [Modelo y pesos de Hugging Face ↗](https://huggingface.co/gai-labs/reflex-1) [Explore el modelo ↓](https://www.goodailabs.com/#project-details) [Lea el anuncio ↗](https://www.goodailabs.com/es/blog/reflex-1-fast-decisions/) ## Descripción general Muchas decisiones de los agentes terminan con una elección: qué cola recibe una solicitud, qué herramienta se ajusta a una tarea o qué acción sigue. Reflex-1 puntúa las elecciones que ofrece su solicitud en una sola pasada. Devuelve una distribución de probabilidad que la aplicación puede usar para tomar esa decisión. La investigación sigue la línea de modelos de decisión explorada por [Jev](https://docs.typesafe.ai/introduction), con una arquitectura y un procedimiento de entrenamiento supervisado propios. Un codificador de contexto de 28 capas y otro de candidatos de seis capas alimentan un cabezal de puntuación compartido. El checkpoint actual actualiza los 420,778,370 parámetros. La descarga pública predeterminada es el último checkpoint ajustado. Su ficha contiene los resultados de evaluación y las mediciones de CPU actuales. Los estudios y las grabaciones fechados de abajo conservan la identificación de sus checkpoints originales. Modelo de decisión Versión pública · entorno de ejecución 1.0.0 Utilice Elija entre las opciones que ofrece una aplicación: etiquetas, rutas o posibles acciones. Entrada → salida Estado, pregunta y de 1 a 255 opciones → una distribución de opciones en una sola pasada. modelo 421M parámetros. Un codificador de contexto de 28 capas, otro de candidatos de 6 capas y un cabezal de puntuación compartido. Ejecutar localmente CPU o GPU · FP32. La repetición actual en CPU midió 2.17 GiB de memoria máxima del proceso con uno o cuatro hilos de cálculo. Evaluación 92.93% en un subconjunto reservado de 495 casos de Banking77; 21/30 episodios nativos de MiniWoB++. Las familias de tareas están representadas en el entrenamiento. Acceso Pesos públicos, tokenizadores y código de inferencia en Apache 2.0. Texto en inglés; tiempo de ejecución 1.0.0. La descarga predeterminada es el último checkpoint ajustado. Los estudios y las grabaciones fechados que aparecen a continuación corresponden a checkpoints anteriores. La aplicación proporciona las opciones y controla su ejecución. [Ponderaciones e inferencia ↗](https://huggingface.co/gai-labs/reflex-1)[Resultados de la versión ↗](https://www.goodailabs.com/es/research/reflex-1/#current-results) ## Resultados actuales La versión del 5 de octubre completó 21/30 episodios nativos de navegador MiniWoB++ con un controlador fijo. Obtuvo 92.93% en 495 ejemplos de Banking77. Son subconjuntos reservados de familias de tareas presentes en el entrenamiento, no puntuaciones de benchmarks completos. Checkpoint del 5 de octubre · subconjuntos de clasificación reservados Tarea | Aciertos / evaluados | Exactitud | AG News | 465 / 500 | 93.00% | SST-5 | 299 / 500 | 59.80% | Emotion | 458 / 500 | 91.60% | Banking77 | 460 / 495 | 92.93% | BoolQ | 171 / 202 | 84.65% | MNLI | 436 / 500 | 87.20% | RACE | 287 / 500 | 57.40% | SciQ | 123 / 128 | 96.09% | En una CPU Intel Xeon Platinum 8558, la inferencia de Banking77 tardó 375.2 ms de mediana y 452.1 ms de p95 con cuatro hilos de cómputo. El pico de memoria del proceso fue de 2.17 GiB, incluyendo carga, calentamiento e inferencia. Mediciones actuales en CPU Intel Xeon Platinum 8558 · FP32 · lote de 1 Un hilo de cómputo Latencia · menor es más rápidoMediana//p95 - AG News 1209.7 / 1385.0 ms - SST-5 973.6 / 1160.3 ms - Emotion 956.9 / 1165.8 ms - Banking77 1101.7 / 1276.9 ms - BoolQ 1600.8 / 2710.6 ms 01,5003,000 ms Cuatro hilos de cómputo Latencia · menor es más rápidoMediana//p95 - AG News 389.5 / 480.4 ms - SST-5 320.6 / 404.2 ms - Emotion 318.8 / 391.0 ms - Banking77 375.2 / 452.1 ms - BoolQ 486.7 / 782.2 ms 01,5003,000 ms 480 llamadas por configuración de hilos sobre 120 entradas en dos procesos nuevos. Incluye tokenización e inferencia; excluye carga y calentamiento. Host compartido, entorno de evaluación y sin caché entre solicitudes. La evaluación completa sigue pendiente. BoolQ, RACE y el diagnóstico público de JevBench retrocedieron respecto al checkpoint anterior; Dino nativo alcanzó el objetivo de 60 segundos en 0/16 intentos. No se ha medido la latencia actual en GPU. La [evaluación publicada](https://huggingface.co/gai-labs/reflex-1/blob/84c2cd49d31f73544e1e17539092056e741e7f03/evaluation.json) recoge el checkpoint, las condiciones y las pruebas pendientes. ## Cómo funciona Las respuestas candidatas se proporcionan con cada solicitud. El modelo admite entre 1 y 255 opciones por pregunta, dentro de sus límites simbólicos, y varias preguntas pueden compartir un estado empaquetado. Una aplicación de soporte puede proporcionar sus propias colas; un agente puede proporcionar descripciones de las herramientas que tiene disponibles. Los nuevos tipos de decisión necesitan sus propias pruebas de precisión. El modelo puntúa las opciones suministradas; la aplicación construye los argumentos de la herramienta y decide qué acciones están permitidas. El texto estatal tiene un límite de 512 fichas de tokenización de contexto y se puede acortar aún más con el presupuesto solicitado. Cada opción acepta hasta 512 fichas de tokenización de opciones. Inspeccione state_truncated cuándo es posible que el contexto se haya acortado. Reflex-1//Modelo de decisión ### De una pregunta a una elección. - 01 / Proporcionar #### Defina la decisión. Su solicitud proporciona al estado una pregunta y las opciones sobre las que puede tomar medidas. Estas opciones pueden cambiar con cada solicitud: colas de soporte, herramientas disponibles o acciones permitidas. Estado + pregunta Al cliente se le cobró dos veces. ¿Qué número coincide? Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo ↓ Contexto + preguntaModernBERT Cada elecciónMiniLM ↓ Cabezal anotador compartidoProbabilidades de elección ↓ SolicitudPermiso → argumentos → acción Solicitud de soporte ilustrativa. La aplicación define el conjunto de candidatos. - 02 / Codificar #### Representa el contexto y a los candidatos. Un codificador ModernBERT adaptado lee el estado y la pregunta. Un codificador MiniLM congelado representa cada opción suministrada. Varias preguntas pueden compartir un estado repleto. Estado + pregunta Al cliente se le cobró dos veces. ¿Qué número coincide? Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo ↓ Contexto + preguntaModernBERT Cada elecciónMiniLM ↓ Cabezal anotador compartidoProbabilidades de elección ↓ SolicitudPermiso → argumentos → acción Dos codificadores alimentan un cabezal de puntuación compartido. Este es un esquema de la arquitectura de vista previa. - 03 / Puntuar #### Anota todas las opciones ofrecidas en un solo pase. El encabezado compartido combina las representaciones del contexto y de los candidatos y, a continuación, devuelve una distribución de probabilidad sobre las opciones proporcionadas. Los nuevos tipos de decisión aún necesitan pruebas de precisión y calibración. Estado + pregunta Al cliente se le cobró dos veces. ¿Qué número coincide? Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo ↓ Contexto + preguntaModernBERT Cada elecciónMiniLM ↓ Cabezal anotador compartidoProbabilidades de elección ↓ SolicitudPermiso → argumentos → acción Una puntuación por candidato suministrado, normalizada a una distribución de probabilidad. - 04 / Actuar #### Deje que la aplicación lleve a cabo la decisión. La aplicación decide qué acciones están permitidas, construye los argumentos de la herramienta y ejecuta la acción seleccionada. Reflex-1 proporciona las puntuaciones; el sistema circundante es el propietario del circuito de control. Estado + pregunta Al cliente se le cobró dos veces. ¿Qué número coincide? Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo ↓ Contexto + preguntaModernBERT Cada elecciónMiniLM ↓ Cabezal anotador compartidoProbabilidades de elección ↓ SolicitudPermiso → argumentos → acción El límite de la aplicación es importante: puntuar una herramienta no la ejecuta. Vista previa de la arquitectura del desarrollo público. La solicitud de soporte ilustra el formato de entrada. ## Ejemplos Los ejemplos y las comparaciones de calidad de decisión siguientes usan la instantánea del 3 de octubre. Las mediciones de velocidad y recursos se identifican por separado. Cada grabación conserva su final observado, incluidos los fallos. ### Chromium Dino Esta grabación usa el juego original chrome://dino de Chromium. Reflex-1 recibe la geometría de los obstáculos visibles y elige correr, saltar o agacharse. Los eventos de teclado nativos ejecutan esas opciones mientras el reloj del juego sigue avanzando durante la inferencia. El vídeo muestra imágenes reales del navegador a velocidad normal. Reflex-1 · Chromium original43.6 s · VÍDEO MUDO [Ver Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-002-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 en Chromium Dino nativo, con geometría visible estructurada del motor. Versión del 3 de octubre de 2026. La grabación completa de un recorrido independiente termina en colisión a los 42.309 segundos (puntuación 535); no completa los 60 segundos. El navegador sigue durante la inferencia. Grabación del navegador a velocidad normal; el reloj del juego sigue durante la inferencia. Las dos pruebas terminaron en colisión tras 42.31 segundos y 30.41 segundos; ninguna llegó al límite de 60 segundos. La más larga aparece primero. Son recorridos aleatorios independientes, por lo que no permiten una comparación emparejada de modelos. La segunda prueba completa se conserva abajo. Ver el segundo intento de Dino Reflex-1 · Chromium original31.8 s · VÍDEO MUDO [Ver Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-003-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 en Chromium Dino nativo, con geometría visible estructurada del motor. Versión del 3 de octubre de 2026. La grabación completa de un recorrido independiente termina en colisión a los 30.410 segundos (puntuación 351); no completa los 60 segundos. El navegador sigue durante la inferencia. Grabación del navegador a velocidad normal; el reloj del juego sigue durante la inferencia. ### ViZDoom El juego es el escenario Defend the Center de ViZDoom nativo, en dificultad 5. Reflex-1 elige acciones a partir de límites de objetos visibles, salud y munición. Es un controlador de estado estructurado; no infiere acciones a partir de píxeles. La grabación conserva el ejemplo declarado previamente, con una sola vista de Reflex-1. Reflex-1 · ViZDoom nativo36.5 s · VÍDEO MUDO [Ver Reflex-1 · ViZDoom (MP4)](https://www.goodailabs.com/media/reflex-1/preview/vizdoom-510001-clean.mp4). Reflex-1 · ViZDoom. Reflex-1 en ViZDoom 1.3.1 nativo, Defend the Center, dificultad 5. Versión del 3 de octubre de 2026; semilla de grabación declarada: 510001. El episodio completo termina en muerte a los 34.514 de los 45 segundos de simulación permitidos, con 30 bajas. Recibe etiquetas visibles del motor y salud/munición, no píxeles. La reproducción sigue el tiempo de simulación y excluye demoras de inferencia. La reproducción sigue el tiempo de simulación, sin demoras de inferencia; se conserva la pausa final original. En los 32 episodios reservados, esta versión logró una media de 18.88 bajas y 22.47 segundos de supervivencia. Todos terminaron antes del límite de 45 segundos. El gráfico conserva todos los modelos externos evaluados y los recuentos completos de episodios. ViZDoom · bajas y límites de supervivencia 3 de octubre de 2026 · versión de desarrollo 70a843878214 Defend the Center · dificultad 5 Bajas · mayor es mejorMedia · intervalo del 95% - Reflex-10/32 llegaron a 45 s · 32 muertes · 0 errores · supervivencia media 22.47 s 18.9IC del 95% 16.6–21.2 - Laya0/32 llegaron a 45 s · 32 muertes · 0 errores · supervivencia media 4.90 s 1.4IC del 95% 1.2–1.6 - OpenJev · DeBERTa0/32 llegaron a 45 s · 32 muertes · 0 errores · supervivencia media 4.90 s 1.4IC del 95% 1.2–1.6 - Kev-0.8B0/32 llegaron a 45 s · 32 muertes · 0 errores · supervivencia media 4.90 s 1.4IC del 95% 1.2–1.6 010203040 Aquí Reflex-1 designa los pesos de desarrollo del 3 de octubre, no la descarga predeterminada ni una versión final. Motor ViZDoom original, entradas de estado visible estructurado y acciones argmax directas; límite de 45 segundos. Se conservan todos los resultados declarados. Los intervalos de la media remuestrean semillas emparejadas 10,000 veces. Reservar semillas no garantiza estados estructurados no vistos. Es una comparación del adaptador y entorno indicados, no un resultado oficial ni una evaluación de políticas con píxeles. Reflex-1 promedia 18.88 bajas y 22.47 segundos de supervivencia, con 0/32 episodios de duración completa. Laya, OpenJev y Kev promedian 1.375 bajas cada uno y también completan 0/32. Los modelos de referencia se usaron tal como se distribuyen; sus entrenamientos difieren. ### Flujos de trabajo en el navegador Son sitios sintéticos WebGym alojados localmente y distribuidos con Laya Browser. Los estados se capturaron en Chromium real y el verificador original determina el éxito. Reflex-1 selecciona acciones y objetivos; un auxiliar Qwen3-1.7B compartido aporta texto y valores de listas desplegables. El resultado evalúa el sistema completo. Reflex-1 · WebGym sintético30.1 s · 4× · VÍDEO MUDO [Ver Reserva de restaurante · tarea completada (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-restaurant-960000-clean.mp4). Reserva de restaurante · tarea completada. Versión de desarrollo del 3 de octubre; 15 acciones. Estados capturados en Chromium y reproducidos a 4× el tiempo real, con desenlace y pausa final completos. Tarea sintética local con un auxiliar de texto Qwen3-1.7B compartido. Esta versión difiere de los pesos predeterminados del Hub. Reflex-1 · WebGym sintético8.1 s · 4× · VÍDEO MUDO [Ver Tarea de compra · objetivo no completado (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-shop-960000-clean.mp4). Tarea de compra · objetivo no completado. Versión de desarrollo del 3 de octubre; 4 acciones. Estados capturados en Chromium y reproducidos a 4× el tiempo real, con desenlace y pausa final completos. Tarea sintética local con un auxiliar de texto Qwen3-1.7B compartido. Esta versión difiere de los pesos predeterminados del Hub. La reserva de restaurante tiene éxito; la compra falla. Ambas usan la misma semilla de tarea declarada previamente y conservan el desenlace. La reproducción va a 4× el tiempo real, con los estados capturados y la pausa final conservados. Son resultados de desarrollo en sitios sintéticos, no puntuaciones de MiniWoB++, WebArena ni sitios reales. Tareas completadas · WebGym sintético 3 de octubre de 2026 · versión de desarrollo 70a843878214 Episodios completados (%) · mayor es mejorValor registrado - Reflex-1485 llamadas de decisión (0 errores) · 102 llamadas al auxiliar (0 errores HTTP / 5 de contrato) 13/35 - Laya Browser505 llamadas de decisión (0 errores) · 100 llamadas al auxiliar (0 errores HTTP / 7 de contrato) 17/35 - Laya56 llamadas de decisión (0 errores) · 12 llamadas al auxiliar (0 errores HTTP / 0 de contrato) 0/35 - OpenJev · DeBERTa35 llamadas de decisión (24 errores) · 0 llamadas al auxiliar (0 errores HTTP / 0 de contrato) 0/35 - Kev-0.8B196 llamadas de decisión (0 errores) · 82 llamadas al auxiliar (0 errores HTTP / 0 de contrato) 1/35 0255075100 Aquí Reflex-1 designa los pesos de desarrollo del 3 de octubre, no la descarga predeterminada ni una versión final. Captura real en Chromium de sitios WebGym sintéticos locales. Todos los grupos usan el mismo ejecutor, auxiliar Qwen3-1.7B y límite de 40 pasos. Reflex-1 usa autocast BF16 y 1,024 tokens de estado / 16,384 de solicitud; las demás condiciones están en la descarga. Incluye los 35 intentos por grupo, fallos de solicitud y errores del auxiliar. Es independiente de MiniWoB++, WebArena y sitios reales. La comprobación final del sitio registra 13/35 tareas completadas por Reflex-1 y 17/35 por Laya Browser. El especialista sigue por delante; también se muestran los otros tres grupos externos. Reflex-1 completó 13/35 tareas y Laya Browser 17/35. Los denominadores incluyen todos los intentos, fallos y errores de solicitud. Un piloto posterior en el entorno oficial MiniWoB++ completó 0/30 tareas con esta versión; los resultados sintéticos no deben interpretarse como éxito en ese benchmark. ## Calidad de las decisiones Typed Decisions abarca atención al cliente, facturas, alertas de seguridad y trazas de agentes. La evaluación conserva los grupos de estados originales y pide a cada modelo los mismos cinco juicios mediante una interfaz común de opciones. Reflex-1 acertó 1,508/2,000 juicios (75.4%). Decisiones estructuradas 3 de octubre de 2026 · versión de desarrollo 70a843878214 Atención al cliente Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95% - Reflex-1383/500 correctas · 0 errores · 0 estados truncados 76.6%IC del 95% 72.0–80.8% - Laya · nativa210/500 correctas · 0 errores · 39 estados truncados 42.0%IC del 95% 38.2–45.8% - OpenJev · DeBERTa206/500 correctas · 0 errores · 350 estados truncados 41.2%IC del 95% 37.8–44.0% - Kev-0.8B314/500 correctas · 0 errores · 10 estados truncados 62.8%IC del 95% 58.2–67.4% 0255075100 Procesamiento de facturas Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95% - Reflex-1394/500 correctas · 0 errores · 0 estados truncados 78.8%IC del 95% 75.0–82.4% - Laya · nativa192/500 correctas · 0 errores · 0 estados truncados 38.4%IC del 95% 32.6–44.6% - OpenJev · DeBERTa203/500 correctas · 0 errores · 500 estados truncados 40.6%IC del 95% 38.2–43.0% - Kev-0.8B252/500 correctas · 0 errores · 0 estados truncados 50.4%IC del 95% 45.2–55.8% 0255075100 Alertas de seguridad Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95% - Reflex-1362/500 correctas · 0 errores · 0 estados truncados 72.4%IC del 95% 68.4–76.2% - Laya · nativa167/500 correctas · 0 errores · 0 estados truncados 33.4%IC del 95% 30.0–37.0% - OpenJev · DeBERTa210/500 correctas · 0 errores · 275 estados truncados 42.0%IC del 95% 39.2–44.6% - Kev-0.8B236/500 correctas · 0 errores · 0 estados truncados 47.2%IC del 95% 42.6–51.8% 0255075100 Trazas de agentes Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95% - Reflex-1369/500 correctas · 0 errores · 0 estados truncados 73.8%IC del 95% 69.0–78.4% - Laya · nativa193/500 correctas · 0 errores · 0 estados truncados 38.6%IC del 95% 33.4–44.0% - OpenJev · DeBERTa192/500 correctas · 0 errores · 0 estados truncados 38.4%IC del 95% 34.6–42.2% - Kev-0.8B179/500 correctas · 0 errores · 0 estados truncados 35.8%IC del 95% 31.6–40.4% 0255075100 Aquí Reflex-1 designa los pesos de desarrollo del 3 de octubre, no la descarga predeterminada ni una versión final. 400 estados fuente reservados se amplían a 2,000 juicios, 500 por flujo. Los intervalos remuestrean estados fuente conservando las cinco cabezas relacionadas. Límites de tokens: Reflex-1: estado 1,024, solicitud 4,096; Laya · nativo: solicitud 512, instrucción/opciones 192; OpenJev · DeBERTa: estado 256, solicitud 512; Kev-0.8B: estado 512, rama con estado 2,048. Acortamientos de instrucciones/opciones en toda la cohorte (no sumables entre gráficos): Laya · nativo 0/2,000. Son recuentos separados de los estados truncados anteriores. Concordancia con la opción más frecuente del profesor mediante una interfaz común. Son resultados de conjuntos adaptados, no una puntuación oficial de múltiples cabezas. En la cohorte reservada de CLINC, Reflex-1 respondió correctamente a 3,680/4,490 solicitudes de intención y fuera de alcance (82.0%). En selección de herramientas desconocidas acertó 72/87, por debajo del mejor resultado externo de 82/87. Abajo se muestran fortalezas y limitaciones. Enrutamiento de intenciones 3 de octubre de 2026 · versión de desarrollo 70a843878214 Solicitudes conocidas y desconocidas Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95% - Reflex-13,680/4,490 correctas · 0 errores · 0 estados truncados · 64 rechazos incorrectos · 370 aceptaciones incorrectas 82.0%IC del 95% 80.8–83.1% - Laya · nativa1,425/4,490 correctas · 0 errores · 0 estados truncados · 0 rechazos incorrectos · 942 aceptaciones incorrectas 31.7%IC del 95% 30.3–33.2% - Laya · ampliado1,017/4,490 correctas · 0 errores · 0 estados truncados · 0 rechazos incorrectos · 942 aceptaciones incorrectas 22.7%IC del 95% 21.4–23.9% - OpenJev · DeBERTa2,496/4,490 correctas · 0 errores · 0 estados truncados · 5 rechazos incorrectos · 939 aceptaciones incorrectas 55.6%IC del 95% 54.1–57.0% - Kev-0.8B2,298/4,490 correctas · 0 errores · 0 estados truncados · 1 rechazos incorrectos · 937 aceptaciones incorrectas 51.2%IC del 95% 49.6–52.6% 0255075100 Aquí Reflex-1 designa los pesos de desarrollo del 3 de octubre, no la descarga predeterminada ni una versión final. 4,490 solicitudes reservadas: 3,548 intenciones conocidas y 942 fuera de alcance. Se muestran Laya nativo y su control de contexto ampliado declarado por separado. Límites de tokens: Reflex-1: estado 1,024, solicitud 4,096; Laya · nativo: solicitud 512, instrucción/opciones 192; Laya · ampliado: solicitud 2,048, instrucción/opciones 1,536; OpenJev · DeBERTa: estado 256, solicitud 512; Kev-0.8B: estado 512, rama con estado 2,048. Acortamientos de instrucciones/opciones en toda la cohorte (no sumables entre gráficos): Laya · nativo 4,490/4,490; Laya · ampliado 0/4,490. Son recuentos separados de los estados truncados anteriores. Reflex-1 enruta correctamente 3,108/3,548 solicitudes conocidas y rechaza 572/942 fuera de alcance. Rechaza por error 64 conocidas y acepta 370 fuera de alcance. Se conservan todas las condiciones externas. Selección entre herramientas desconocidas 3 de octubre de 2026 · versión de desarrollo 70a843878214 Selección de herramientas Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95% - Reflex-172/87 correctas · 0 errores · 0 estados truncados 82.8%IC del 95% 74.7–90.8% - Laya · nativa80/87 correctas · 0 errores · 14 estados truncados 92.0%IC del 95% 86.2–97.7% - Laya · ampliado80/87 correctas · 0 errores · 0 estados truncados 92.0%IC del 95% 86.2–97.7% - OpenJev · DeBERTa82/87 correctas · 0 errores · 30 estados truncados 94.3%IC del 95% 88.5–98.9% - Kev-0.8B81/87 correctas · 0 errores · 1 estados truncados 93.1%IC del 95% 87.4–97.7% 0255075100 Aquí Reflex-1 designa los pesos de desarrollo del 3 de octubre, no la descarga predeterminada ni una versión final. 87 solicitudes reservadas, con nombres de herramientas y estados normalizados separados antes del entrenamiento. Es una adaptación de elección de herramientas; generar argumentos y ejecutar queda fuera del alcance. Límites de tokens: Reflex-1: estado 1,024, solicitud 4,096; Laya · nativo: solicitud 512, instrucción/opciones 192; Laya · ampliado: solicitud 2,048, instrucción/opciones 1,536; OpenJev · DeBERTa: estado 256, solicitud 512; Kev-0.8B: estado 512, rama con estado 2,048. Acortamientos de instrucciones/opciones en toda la cohorte (no sumables entre gráficos): Laya · nativo 87/87; Laya · ampliado 65/87. Son recuentos separados de los estados truncados anteriores. Reflex-1 selecciona correctamente 72/87 herramientas. Laya alcanza 80/87 en cada condición declarada, OpenJev 82/87 y Kev 81/87. Se evalúa la elección entre herramientas proporcionadas, no la generación de argumentos ni la ejecución. Son adaptaciones a opciones comunes con cohortes declaradas, no envíos a clasificaciones oficiales. Los modelos externos se evaluaron tal como se distribuyen, sin el entrenamiento específico de Reflex-1. Las figuras conservan los intervalos de incertidumbre, presupuestos de tokens y recuentos de truncamiento originales. ## Velocidad y recursos Las mediciones de esta sección corresponden al checkpoint del 2 de octubre. Las del checkpoint actual están disponibles en la ficha de modelo enlazada arriba. ### Latencia de solicitud del H200 Reproducimos 120 solicitudes distintas dos veces por modelo en una NVIDIA H200 compartida. Procedían de cinco entornos de juego y navegador. Todos los modelos recibieron las mismas entradas, con una solicitud en vuelo a la vez. Latencia de solicitud del H200 120 entradas · dos repeticiones · una solicitud en vuelo Milisegundos · cuanto más bajo es más rápidoMediana//p95 - Reflex-1FP32 27.5 / 30.5 - OpenJevFP32 32.0 / 33.8 - Laya (nativa)BF16 27.1 / 142.0 - Laya (repetición de FP32)FP32 40.2 / 44.4 04080120160 Punto: mediana. Final de línea: p95. Incluye la tokenización, la puntuación y el loopback HTTP; excluye la carga y el calentamiento. 120 entradas idénticas, cada una reproducida dos veces, con una solicitud en vuelo. El tiempo incluye el formateo, la tokenización, la inferencia y el HTTP en bucle invertido. Los tramos muestran una mediana de p95. La precisión difiere según la etiqueta; la repetición de Laya del FP32 cambió dos decisiones. Tabla de medición y protocolo completos H200 · solicitudes idénticas · latencia en milisegundos · cuanto más bajo, mejor modelo | Recursos de cómputo | Mediana | p95 | reflex-1 | FP32 | 27.5 | 30.5 | OpenJev | FP32 | 32.0 | 33.8 | Laya (nativa) | BF16 | 27.1 | 142.0 | Laya (repetición de FP32) | FP32 | 40.2 | 44.4 | Laya native utiliza la transmisión automática BF16; también se incluye una reproducción FP32 independiente. OpenJev es el punto de control público de DeBerta, no el Jev alojado. Estos tiempos de solicitud no miden el éxito de las tareas ni el rendimiento simultáneo. Grabado el 2026-09-29. La mediana de reflex-1 fue de 27.5 ms y su p95 de 30.5 ms. Fue más rápido que OpenJev en FP32 y que Laya en la medición separada en FP32. La configuración nativa de Laya usó autocast BF16 y obtuvo una mediana ligeramente menor. El equipo compartido y el tamaño de la muestra limitan las conclusiones sobre resultados tan próximos. El temporizador incluye la tokenización, la puntuación del modelo, la normalización de la salida y el HTTP de bucle invertido. Excluye la carga y tres solicitudes de calentamiento. Las cachés de respuestas y opciones estaban deshabilitadas. No medimos el rendimiento de los servidores simultáneos en esta ejecución. OpenJev aquí es el punto de control público de DeBerta; no es el servicio Jev alojado. ### LATENCIA DE LA CPU M4 La prueba de la CPU utilizó un MacBook Air M4, un FP32 y un tamaño de lote uno. Cada modelo utilizó un subproceso intraoperatorio de PyTorch, un subproceso interoperativo y un límite de subprocesos BLAS de uno. Cada tarea tenía 24 casos distintos, cada uno repetido dos veces. El orden del modelo se equilibró en ocho bloques de ejecución. Latencia de solicitud de CPU M4 FP32 · lote uno · subprocesos de PyTorch 1/1 · límite BLAS 1 Banking77 Milisegundos · escala logarítmica · cuanto más bajo es más rápidoMediana//p95 - Reflex-1 345.2 / 692.0 - OpenJev 1,332.6 / 2,857.1 - Laya 912.4 / 2,649.9 - Kev 4,283.4 / 11,073.7 1001 k10 mil20 mil Emotion Milisegundos · escala logarítmica · cuanto más bajo es más rápidoMediana//p95 - Reflex-1 256.2 / 610.4 - OpenJev 381.8 / 1,029.5 - Laya 240.1 / 427.7 - Kev 1,121.9 / 4,422.3 1001 k10 mil20 mil AG News Milisegundos · escala logarítmica · cuanto más bajo es más rápidoMediana//p95 - Reflex-1 321.7 / 578.7 - OpenJev 424.5 / 934.0 - Laya 324.1 / 760.5 - Kev 1,356.5 / 4,997.2 1001 k10 mil20 mil SST-5 Milisegundos · escala logarítmica · cuanto más bajo es más rápidoMediana//p95 - Reflex-1 299.1 / 631.0 - OpenJev 360.5 / 894.5 - Laya 250.7 / 548.5 - Kev 902.2 / 4,480.5 1001 k10 mil20 mil BoolQ Milisegundos · escala logarítmica · cuanto más bajo es más rápidoMediana//p95 - Reflex-1 463.4 / 1,329.1 - OpenJev 451.9 / 1,398.9 - Laya 440.4 / 1,587.9 - Kev 1,775.3 / 6,548.0 1001 k10 mil20 mil Punto: mediana. Extremo de la línea: p95. Todas las tareas usan la misma escala logarítmica. Memoria: RSS máximo del proceso de 1.50 GiB en una medición separada de Reflex-1; no se midió la memoria por modelo en esta comparación. FP32, tamaño de lote uno; PyTorch usa 1/1 hilos intraoperación/interoperación y BLAS se limita a 1 hilo. Estudio de latencia original: 24 entradas por tarea, cada una repetida dos veces. Una medición separada de 240 solicitudes de Reflex-1 registró 1.50 GiB de RSS máximo del proceso, incluyendo carga, calentamiento e inferencia. La comparación original no registró memoria por modelo. Los segmentos van de la mediana al p95. Laya trunca las opciones de Banking77; Kev usa kernels de CPU de referencia con adaptadores sin fusionar. Tabla de medición y protocolo completos CPU M4 · FP32 · PyTorch intraop/inter-op 1/1 · Límite BLAS 1 · mediana/p95 en milisegundos Tarea | reflex-1 | OpenJev | Laya | Kev | Banking77 | 345.2/ 692.0 | 1332.6/ 2857.1 | 912.4/ 2649.9 | 4283.4/ 11073.7 | Emotion | 256.2/ 610.4 | 381.8/ 1029.5 | 240.1/ 427.7 | 1121.9/ 4422.3 | AG News | 321.7/ 578.7 | 424.5/ 934.0 | 324.1/ 760.5 | 1356.5/ 4997.2 | SST-5 | 299.1/ 631.0 | 360.5/ 894.5 | 250.7/ 548.5 | 902.2/ 4480.5 | BoolQ | 463.4/ 1329.1 | 451.9/ 1398.9 | 440.4/ 1587.9 | 1775.3/ 6548.0 | Presupuestos de tiempo de ejecución nativos. Laya trunca las opciones de Banking77 según su presupuesto original; los resultados del presupuesto ampliado se presentan por separado. Kev usa sus núcleos de referencia de CPU y adaptadores no fusionados. Grabado el 2026-09-24. Memoria medida por Reflex-1: RSS de procesamiento máximo de 1.50 GiB. Reproducción separada del recurso Reflex-1 de las 120 entradas originales, cada una puntuada dos veces. El RSS máximo de todo el proceso incluye importaciones, carga de modelos, calentamiento e inferencia. La comparación de latencia original de cuatro modelos no registraba la memoria por modelo. Grabado el 2026-10-02 UTC. [Mediciones y protocolo de recursos](https://huggingface.co/Goodailabs/reflex-1/resolve/main/assets/cpu-resources.json). Banking77 exige elegir entre 77 intenciones. La mediana de reflex-1 fue de 345.2 ms, frente a 1,332.6 ms de OpenJev en la misma ejecución. En las cinco tareas, las medianas de reflex-1 variaron entre 256.2 y 463.4 ms. Laya era más rápida en varias tareas de menor envergadura. Su presupuesto original, Banking77, truncaba las opciones, por lo que su calendario cubre un conjunto reducido de candidatos. Kev usó núcleos de referencia de CPU con adaptadores no fusionados. En segundo plano, la actividad de los ordenadores portátiles contribuyó a aumentar las latencias de la cola. Esta prueba mide desde la construcción de la solicitud hasta la salida normalizada, con el modelo ya cargado. Las pruebas de CPU y GPU usan solicitudes diferentes; sus tiempos no permiten calcular directamente la aceleración de GPU respecto a CPU. ### Precisión en tareas conocidas reflex-1 obtuvo un 95.0% en Banking77 y un 92.2% en Emotion. Lideró los puntos de control comparados en ambos, empató la mejor puntuación en AG News y SST-5, y obtuvo una puntuación ligeramente inferior a OpenJev en BoolQ. Precisión de las decisiones 500 ejemplos por tarea · diagnósticos de desarrollo Banking77 Precisión (%) · cuanto más alto, mejorValor registrado - Reflex-1 95.0% - OpenJev 90.6% - Laya · nativa 44.4% - Laya · ampliado 55.4% - Kev 82.4% 050100 Emotion Precisión (%) · cuanto más alto, mejorValor registrado - Reflex-1 92.2% - OpenJev 53.0% - Laya · nativa 57.6% - Laya · ampliado 57.6% - Kev 54.4% 050100 AG News Precisión (%) · cuanto más alto, mejorValor registrado - Reflex-1 91.2% - OpenJev 77.4% - Laya · nativa 91.2% - Laya · ampliado 91.2% - Kev 87.2% 050100 SST-5 Precisión (%) · cuanto más alto, mejorValor registrado - Reflex-1 59.8% - OpenJev 59.8% - Laya · nativa 51.0% - Laya · ampliado 51.0% - Kev 55.2% 050100 BoolQ Precisión (%) · cuanto más alto, mejorValor registrado - Reflex-1 86.0% - OpenJev 86.8% - Laya · nativa 71.2% - Laya · ampliado 71.2% - Kev 82.6% 050100 Las familias de tareas se incluyeron en la capacitación y estos subconjuntos se inspeccionaron durante el desarrollo. La exposición al entrenamiento difiere entre los modelos. El presupuesto nativo de Laya trunca las opciones de Banking77. Cada modelo recibió los mismos 500 ejemplos por tarea. Estas familias de tareas se incluyeron en el entrenamiento de Reflex y los subconjuntos se inspeccionaron durante el desarrollo. La exposición al entrenamiento difiere según los modelos. Laya, de presupuesto ampliado, conserva las 77 etiquetas de Banking77. Tabla de medición y protocolo completos Precisión (%) · 500 ejemplos por tarea · diagnósticos de desarrollo Tarea | reflex-1 | Laya, nativa | Laya, ampliada | OpenJev | Kev | Banking77 | 95.0 | 44.4 | 55.4 | 90.6 | 82.4 | Emotion | 92.2 | 57.6 | 57.6 | 53.0 | 54.4 | AG News | 91.2 | 91.2 | 91.2 | 77.4 | 87.2 | SST-5 | 59.8 | 51.0 | 51.0 | 59.8 | 55.2 | BoolQ | 86.0 | 71.2 | 71.2 | 86.8 | 82.6 | El SDK 0.3.20 de Laya se muestra con presupuestos de tokens nativos y ampliados. El presupuesto nativo de Banking77 trunca el conjunto de opciones; el presupuesto ampliado conserva las 77 etiquetas. Se trata de diagnósticos de desarrollo, no de evaluaciones de transferencia independientes. Se trataba de 500 ejemplos de diagnóstico por tarea. Las familias de tareas se incluyeron en la capacitación y inspeccionamos los subconjuntos durante el desarrollo. Los presupuestos de capacitación y la exposición previa difieren entre los modelos. La precisión se midió por separado de la latencia, en más ejemplos. El punto de control general completó 0 de las 80 pruebas con nuestro controlador de navegador personalizado. El resultado expone una brecha sustancial entre la clasificación de tareas familiares y el control autónomo. La transferencia a preguntas desconocidas y la calibración de probabilidades siguen siendo problemas de evaluación abiertos. ### Formación y almacenamiento El modelo de servicio tiene 420,778,370 parámetros después de combinar los adaptadores. ModernBERT codifica el estado y las preguntas; un codificador MiniLM congelado representa las opciones. La cabecera compartida combina sus representaciones. reflex-1 · tamaño de la ración y presupuesto de adaptación Recurso | Configuración grabada | Parámetros de servicio | 420,778,370 | Parámetros entrenados en adaptación | 9,036,290 | Hardware de adaptación | 1 × NVIDIA H200 | Carrera principal | 6,000 actualizaciones · 75 min 7 seg | Modelo FP32 extraído en disco | ≈ 1.69 GB | Memoria de proceso de CPU medida | RSS máximo de 1.50 GiB · reproducción separada de 240 solicitudes | Subprocesos de procesamiento de CPU | PyTorch intraop/inter-op 1/1 · Límite BLAS 1 | La ejecución principal de la adaptación actualizó 9,036,290 parámetros en 6,000 pasos, utilizando 290,657 registros de ocho familias de tareas. Se necesitaron 75 minutos y 7 segundos en un H200, incluidas las pantallas de desarrollo y los puntos de control guardados. El entrenamiento previo del modelo base, la preparación de datos, el ajuste de la proyección y los experimentos anteriores son costos adicionales. El modelo FP32 extraído ocupa aproximadamente 1.69 GB en disco. La medición separada de recursos de CPU registró 1.50 GiB de RSS máximo del proceso, incluyendo memoria asignada por el framework, tokenizadores, carga, calentamiento e inferencia. El uso de memoria de GPU aún no se ha medido. ## Acceso modelo La versión [pública Hugging Face](https://huggingface.co/gai-labs/reflex-1) contiene los pesos FP32 de 1.68 GB, ambos tokenizadores y una implementación autónoma de Transformers en Apache 2.0. No se requiere ninguna cuenta, clave de API ni acceso a GitHub. Usa Python 3.12: ``` python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0" ``` ``` import torch from transformers import AutoModel torch.set_num_threads(1) model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True) decision = model.predict( state="The customer was charged twice for one card payment.", question="Choose the matching issue.", options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"], )[0] print(decision.choice) ``` Cargue el modelo una vez y reutilícelo. La tarjeta modelo documenta la inferencia por lotes, las preguntas múltiples, la carga sin conexión y los hashes de publicación. El repositorio de desarrollo permanece privado; el paquete público incluye el código necesario para la inferencia. El entrenamiento original utilizó RACE y SciQ, cuyas condiciones incluyen restricciones no comerciales. La [ficha del modelo](https://huggingface.co/gai-labs/reflex-1) documenta su uso y las versiones fijas. La revisión de procedencia no determina cómo se aplican esas condiciones a los pesos entrenados. ## Grabaciones y reproducibilidad Usa la [revisión fija del Hub del 3 de octubre](https://huggingface.co/gai-labs/reflex-1/tree/ae50bf81cddcaaac2aa18021d862433ca69da197) para reproducir estas grabaciones. Los gráficos conservan los resultados medidos, incluidas las pérdidas de capacidades previas. Cada grabación identifica el entorno, el formato de entrada y la velocidad de reproducción. La versión actual tiene una evaluación independiente enlazada desde su ficha de modelo. Estas grabaciones y estudios conservan sus resultados originales. También en investigación ## También en investigación - ### [Samsara-VLA](https://www.goodailabs.com/es/research/samsara-vla/) Dos políticas robóticas compactas para manipulación guiada por lenguaje. Vea cómo recogen, colocan, abren y completan tareas de varios pasos. - ### [VIO-lens-2](https://www.goodailabs.com/es/research/vio-lens-2/) Investigación en curso. Correspondencia ## Escríbenos Póngase en contacto con nosotros acerca de las evaluaciones, el acceso a modelos o una colaboración de investigación. [research@goodailabs.com](mailto:research@goodailabs.com?subject=Reflex-1)