ES
Contacto
Menú

Investigación Pesos públicos

Reflex-1

Modelos de decisión para agentes

Un modelo de decisión de 421M parámetros para agentes. Una sola pasada, en CPU o GPU.

Pesos ajustados disponibles en Hugging Face.

Descripción general

Muchas decisiones de los agentes terminan con una elección: qué cola recibe una solicitud, qué herramienta se ajusta a una tarea o qué acción sigue. Reflex-1 puntúa las elecciones que ofrece su solicitud en una sola pasada. Devuelve una distribución de probabilidad que la aplicación puede usar para tomar esa decisión.

La investigación sigue la línea de modelos de decisión explorada por Jev, con una arquitectura y un procedimiento de entrenamiento supervisado propios. Un codificador de contexto de 28 capas y otro de candidatos de seis capas alimentan un cabezal de puntuación compartido. El checkpoint actual actualiza los 420,778,370 parámetros.

La descarga pública predeterminada es el último checkpoint ajustado. Su ficha contiene los resultados de evaluación y las mediciones de CPU actuales. Los estudios y las grabaciones fechados de abajo conservan la identificación de sus checkpoints originales.

Modelo de decisión

Versión pública · entorno de ejecución 1.0.0
Utilice
Elija entre las opciones que ofrece una aplicación: etiquetas, rutas o posibles acciones.
Entrada → salida
Estado, pregunta y de 1 a 255 opciones → una distribución de opciones en una sola pasada.
modelo
421M parámetros. Un codificador de contexto de 28 capas, otro de candidatos de 6 capas y un cabezal de puntuación compartido.
Ejecutar localmente
CPU o GPU · FP32. La repetición actual en CPU midió 2.17 GiB de memoria máxima del proceso con uno o cuatro hilos de cálculo.
Evaluación
92.93% en un subconjunto reservado de 495 casos de Banking77; 21/30 episodios nativos de MiniWoB++. Las familias de tareas están representadas en el entrenamiento.
Acceso
Pesos públicos, tokenizadores y código de inferencia en Apache 2.0. Texto en inglés; tiempo de ejecución 1.0.0.

La descarga predeterminada es el último checkpoint ajustado. Los estudios y las grabaciones fechados que aparecen a continuación corresponden a checkpoints anteriores. La aplicación proporciona las opciones y controla su ejecución.

Resultados actuales

La versión del 5 de octubre completó 21/30 episodios nativos de navegador MiniWoB++ con un controlador fijo. Obtuvo 92.93% en 495 ejemplos de Banking77. Son subconjuntos reservados de familias de tareas presentes en el entrenamiento, no puntuaciones de benchmarks completos.

Checkpoint del 5 de octubre · subconjuntos de clasificación reservados
TareaAciertos / evaluadosExactitud
AG News465 / 50093.00%
SST-5299 / 50059.80%
Emotion458 / 50091.60%
Banking77460 / 49592.93%
BoolQ171 / 20284.65%
MNLI436 / 50087.20%
RACE287 / 50057.40%
SciQ123 / 12896.09%

En una CPU Intel Xeon Platinum 8558, la inferencia de Banking77 tardó 375.2 ms de mediana y 452.1 ms de p95 con cuatro hilos de cómputo. El pico de memoria del proceso fue de 2.17 GiB, incluyendo carga, calentamiento e inferencia.

Mediciones actuales en CPU

Intel Xeon Platinum 8558 · FP32 · lote de 1

Un hilo de cómputo

Latencia · menor es más rápidoMediana//p95
  1. AG News 1209.7 / 1385.0 ms
  2. SST-5 973.6 / 1160.3 ms
  3. Emotion 956.9 / 1165.8 ms
  4. Banking77 1101.7 / 1276.9 ms
  5. BoolQ 1600.8 / 2710.6 ms

Cuatro hilos de cómputo

Latencia · menor es más rápidoMediana//p95
  1. AG News 389.5 / 480.4 ms
  2. SST-5 320.6 / 404.2 ms
  3. Emotion 318.8 / 391.0 ms
  4. Banking77 375.2 / 452.1 ms
  5. BoolQ 486.7 / 782.2 ms

480 llamadas por configuración de hilos sobre 120 entradas en dos procesos nuevos. Incluye tokenización e inferencia; excluye carga y calentamiento. Host compartido, entorno de evaluación y sin caché entre solicitudes.

La evaluación completa sigue pendiente. BoolQ, RACE y el diagnóstico público de JevBench retrocedieron respecto al checkpoint anterior; Dino nativo alcanzó el objetivo de 60 segundos en 0/16 intentos. No se ha medido la latencia actual en GPU. La evaluación publicada recoge el checkpoint, las condiciones y las pruebas pendientes.

Cómo funciona

Las respuestas candidatas se proporcionan con cada solicitud. El modelo admite entre 1 y 255 opciones por pregunta, dentro de sus límites simbólicos, y varias preguntas pueden compartir un estado empaquetado. Una aplicación de soporte puede proporcionar sus propias colas; un agente puede proporcionar descripciones de las herramientas que tiene disponibles. Los nuevos tipos de decisión necesitan sus propias pruebas de precisión.

El modelo puntúa las opciones suministradas; la aplicación construye los argumentos de la herramienta y decide qué acciones están permitidas. El texto estatal tiene un límite de 512 fichas de tokenización de contexto y se puede acortar aún más con el presupuesto solicitado. Cada opción acepta hasta 512 fichas de tokenización de opciones. Inspeccione state_truncated cuándo es posible que el contexto se haya acortado.

Reflex-1//Modelo de decisión

De una pregunta a una elección.

  1. 01 / Proporcionar

    Defina la decisión.

    Su solicitud proporciona al estado una pregunta y las opciones sobre las que puede tomar medidas. Estas opciones pueden cambiar con cada solicitud: colas de soporte, herramientas disponibles o acciones permitidas.

    Estado + pregunta

    Al cliente se le cobró dos veces.
    ¿Qué número coincide?

    Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo
    Contexto + preguntaModernBERT
    Cada elecciónMiniLM
    Cabezal anotador compartidoProbabilidades de elección
    SolicitudPermiso → argumentos → acción
    Solicitud de soporte ilustrativa. La aplicación define el conjunto de candidatos.
  2. 02 / Codificar

    Representa el contexto y a los candidatos.

    Un codificador ModernBERT adaptado lee el estado y la pregunta. Un codificador MiniLM congelado representa cada opción suministrada. Varias preguntas pueden compartir un estado repleto.

    Estado + pregunta

    Al cliente se le cobró dos veces.
    ¿Qué número coincide?

    Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo
    Contexto + preguntaModernBERT
    Cada elecciónMiniLM
    Cabezal anotador compartidoProbabilidades de elección
    SolicitudPermiso → argumentos → acción
    Dos codificadores alimentan un cabezal de puntuación compartido. Este es un esquema de la arquitectura de vista previa.
  3. 03 / Puntuar

    Anota todas las opciones ofrecidas en un solo pase.

    El encabezado compartido combina las representaciones del contexto y de los candidatos y, a continuación, devuelve una distribución de probabilidad sobre las opciones proporcionadas. Los nuevos tipos de decisión aún necesitan pruebas de precisión y calibración.

    Estado + pregunta

    Al cliente se le cobró dos veces.
    ¿Qué número coincide?

    Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo
    Contexto + preguntaModernBERT
    Cada elecciónMiniLM
    Cabezal anotador compartidoProbabilidades de elección
    SolicitudPermiso → argumentos → acción
    Una puntuación por candidato suministrado, normalizada a una distribución de probabilidad.
  4. 04 / Actuar

    Deje que la aplicación lleve a cabo la decisión.

    La aplicación decide qué acciones están permitidas, construye los argumentos de la herramienta y ejecuta la acción seleccionada. Reflex-1 proporciona las puntuaciones; el sistema circundante es el propietario del circuito de control.

    Estado + pregunta

    Al cliente se le cobró dos veces.
    ¿Qué número coincide?

    Carga duplicadaTarjeta perdidaTarifa desconocidaRetiro de efectivo
    Contexto + preguntaModernBERT
    Cada elecciónMiniLM
    Cabezal anotador compartidoProbabilidades de elección
    SolicitudPermiso → argumentos → acción
    El límite de la aplicación es importante: puntuar una herramienta no la ejecuta.

Vista previa de la arquitectura del desarrollo público. La solicitud de soporte ilustra el formato de entrada.

Ejemplos

Los ejemplos y las comparaciones de calidad de decisión siguientes usan la instantánea del 3 de octubre. Las mediciones de velocidad y recursos se identifican por separado. Cada grabación conserva su final observado, incluidos los fallos.

Chromium Dino

Esta grabación usa el juego original chrome://dino de Chromium. Reflex-1 recibe la geometría de los obstáculos visibles y elige correr, saltar o agacharse. Los eventos de teclado nativos ejecutan esas opciones mientras el reloj del juego sigue avanzando durante la inferencia. El vídeo muestra imágenes reales del navegador a velocidad normal.

Reflex-1 · Chromium original43.6 s VÍDEO MUDO
Reflex-1 · Chromium Dino. Reflex-1 en Chromium Dino nativo, con geometría visible estructurada del motor. Versión del 3 de octubre de 2026. La grabación completa de un recorrido independiente termina en colisión a los 42.309 segundos (puntuación 535); no completa los 60 segundos. El navegador sigue durante la inferencia. Grabación del navegador a velocidad normal; el reloj del juego sigue durante la inferencia.

Las dos pruebas terminaron en colisión tras 42.31 segundos y 30.41 segundos; ninguna llegó al límite de 60 segundos. La más larga aparece primero. Son recorridos aleatorios independientes, por lo que no permiten una comparación emparejada de modelos. La segunda prueba completa se conserva abajo.

Ver el segundo intento de Dino
Reflex-1 · Chromium original31.8 s VÍDEO MUDO
Reflex-1 · Chromium Dino. Reflex-1 en Chromium Dino nativo, con geometría visible estructurada del motor. Versión del 3 de octubre de 2026. La grabación completa de un recorrido independiente termina en colisión a los 30.410 segundos (puntuación 351); no completa los 60 segundos. El navegador sigue durante la inferencia. Grabación del navegador a velocidad normal; el reloj del juego sigue durante la inferencia.

ViZDoom

El juego es el escenario Defend the Center de ViZDoom nativo, en dificultad 5. Reflex-1 elige acciones a partir de límites de objetos visibles, salud y munición. Es un controlador de estado estructurado; no infiere acciones a partir de píxeles. La grabación conserva el ejemplo declarado previamente, con una sola vista de Reflex-1.

Reflex-1 · ViZDoom nativo36.5 s VÍDEO MUDO
Reflex-1 · ViZDoom. Reflex-1 en ViZDoom 1.3.1 nativo, Defend the Center, dificultad 5. Versión del 3 de octubre de 2026; semilla de grabación declarada: 510001. El episodio completo termina en muerte a los 34.514 de los 45 segundos de simulación permitidos, con 30 bajas. Recibe etiquetas visibles del motor y salud/munición, no píxeles. La reproducción sigue el tiempo de simulación y excluye demoras de inferencia. La reproducción sigue el tiempo de simulación, sin demoras de inferencia; se conserva la pausa final original.

En los 32 episodios reservados, esta versión logró una media de 18.88 bajas y 22.47 segundos de supervivencia. Todos terminaron antes del límite de 45 segundos. El gráfico conserva todos los modelos externos evaluados y los recuentos completos de episodios.

ViZDoom · bajas y límites de supervivencia

3 de octubre de 2026 · versión de desarrollo 70a843878214

Defend the Center · dificultad 5

Bajas · mayor es mejorMedia · intervalo del 95%
  1. Reflex-10/32 llegaron a 45 s · 32 muertes · 0 errores · supervivencia media 22.47 s 18.9IC del 95% 16.6–21.2
  2. Laya0/32 llegaron a 45 s · 32 muertes · 0 errores · supervivencia media 4.90 s 1.4IC del 95% 1.2–1.6
  3. OpenJev · DeBERTa0/32 llegaron a 45 s · 32 muertes · 0 errores · supervivencia media 4.90 s 1.4IC del 95% 1.2–1.6
  4. Kev-0.8B0/32 llegaron a 45 s · 32 muertes · 0 errores · supervivencia media 4.90 s 1.4IC del 95% 1.2–1.6

Aquí Reflex-1 designa los pesos de desarrollo del 3 de octubre, no la descarga predeterminada ni una versión final. Motor ViZDoom original, entradas de estado visible estructurado y acciones argmax directas; límite de 45 segundos. Se conservan todos los resultados declarados. Los intervalos de la media remuestrean semillas emparejadas 10,000 veces. Reservar semillas no garantiza estados estructurados no vistos. Es una comparación del adaptador y entorno indicados, no un resultado oficial ni una evaluación de políticas con píxeles.

Reflex-1 promedia 18.88 bajas y 22.47 segundos de supervivencia, con 0/32 episodios de duración completa. Laya, OpenJev y Kev promedian 1.375 bajas cada uno y también completan 0/32. Los modelos de referencia se usaron tal como se distribuyen; sus entrenamientos difieren.

Flujos de trabajo en el navegador

Son sitios sintéticos WebGym alojados localmente y distribuidos con Laya Browser. Los estados se capturaron en Chromium real y el verificador original determina el éxito. Reflex-1 selecciona acciones y objetivos; un auxiliar Qwen3-1.7B compartido aporta texto y valores de listas desplegables. El resultado evalúa el sistema completo.

Reflex-1 · WebGym sintético30.1 s · 4× VÍDEO MUDO
Reserva de restaurante · tarea completada. Versión de desarrollo del 3 de octubre; 15 acciones. Estados capturados en Chromium y reproducidos a 4× el tiempo real, con desenlace y pausa final completos. Tarea sintética local con un auxiliar de texto Qwen3-1.7B compartido. Esta versión difiere de los pesos predeterminados del Hub.
Reflex-1 · WebGym sintético8.1 s · 4× VÍDEO MUDO
Tarea de compra · objetivo no completado. Versión de desarrollo del 3 de octubre; 4 acciones. Estados capturados en Chromium y reproducidos a 4× el tiempo real, con desenlace y pausa final completos. Tarea sintética local con un auxiliar de texto Qwen3-1.7B compartido. Esta versión difiere de los pesos predeterminados del Hub.

La reserva de restaurante tiene éxito; la compra falla. Ambas usan la misma semilla de tarea declarada previamente y conservan el desenlace. La reproducción va a 4× el tiempo real, con los estados capturados y la pausa final conservados. Son resultados de desarrollo en sitios sintéticos, no puntuaciones de MiniWoB++, WebArena ni sitios reales.

Tareas completadas · WebGym sintético

3 de octubre de 2026 · versión de desarrollo 70a843878214
Episodios completados (%) · mayor es mejorValor registrado
  1. Reflex-1485 llamadas de decisión (0 errores) · 102 llamadas al auxiliar (0 errores HTTP / 5 de contrato) 13/35
  2. Laya Browser505 llamadas de decisión (0 errores) · 100 llamadas al auxiliar (0 errores HTTP / 7 de contrato) 17/35
  3. Laya56 llamadas de decisión (0 errores) · 12 llamadas al auxiliar (0 errores HTTP / 0 de contrato) 0/35
  4. OpenJev · DeBERTa35 llamadas de decisión (24 errores) · 0 llamadas al auxiliar (0 errores HTTP / 0 de contrato) 0/35
  5. Kev-0.8B196 llamadas de decisión (0 errores) · 82 llamadas al auxiliar (0 errores HTTP / 0 de contrato) 1/35

Aquí Reflex-1 designa los pesos de desarrollo del 3 de octubre, no la descarga predeterminada ni una versión final. Captura real en Chromium de sitios WebGym sintéticos locales. Todos los grupos usan el mismo ejecutor, auxiliar Qwen3-1.7B y límite de 40 pasos. Reflex-1 usa autocast BF16 y 1,024 tokens de estado / 16,384 de solicitud; las demás condiciones están en la descarga. Incluye los 35 intentos por grupo, fallos de solicitud y errores del auxiliar. Es independiente de MiniWoB++, WebArena y sitios reales.

La comprobación final del sitio registra 13/35 tareas completadas por Reflex-1 y 17/35 por Laya Browser. El especialista sigue por delante; también se muestran los otros tres grupos externos.

Reflex-1 completó 13/35 tareas y Laya Browser 17/35. Los denominadores incluyen todos los intentos, fallos y errores de solicitud. Un piloto posterior en el entorno oficial MiniWoB++ completó 0/30 tareas con esta versión; los resultados sintéticos no deben interpretarse como éxito en ese benchmark.

Calidad de las decisiones

Typed Decisions abarca atención al cliente, facturas, alertas de seguridad y trazas de agentes. La evaluación conserva los grupos de estados originales y pide a cada modelo los mismos cinco juicios mediante una interfaz común de opciones. Reflex-1 acertó 1,508/2,000 juicios (75.4%).

Decisiones estructuradas

3 de octubre de 2026 · versión de desarrollo 70a843878214

Atención al cliente

Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95%
  1. Reflex-1383/500 correctas · 0 errores · 0 estados truncados 76.6%IC del 95% 72.0–80.8%
  2. Laya · nativa210/500 correctas · 0 errores · 39 estados truncados 42.0%IC del 95% 38.2–45.8%
  3. OpenJev · DeBERTa206/500 correctas · 0 errores · 350 estados truncados 41.2%IC del 95% 37.8–44.0%
  4. Kev-0.8B314/500 correctas · 0 errores · 10 estados truncados 62.8%IC del 95% 58.2–67.4%

Procesamiento de facturas

Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95%
  1. Reflex-1394/500 correctas · 0 errores · 0 estados truncados 78.8%IC del 95% 75.0–82.4%
  2. Laya · nativa192/500 correctas · 0 errores · 0 estados truncados 38.4%IC del 95% 32.6–44.6%
  3. OpenJev · DeBERTa203/500 correctas · 0 errores · 500 estados truncados 40.6%IC del 95% 38.2–43.0%
  4. Kev-0.8B252/500 correctas · 0 errores · 0 estados truncados 50.4%IC del 95% 45.2–55.8%

Alertas de seguridad

Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95%
  1. Reflex-1362/500 correctas · 0 errores · 0 estados truncados 72.4%IC del 95% 68.4–76.2%
  2. Laya · nativa167/500 correctas · 0 errores · 0 estados truncados 33.4%IC del 95% 30.0–37.0%
  3. OpenJev · DeBERTa210/500 correctas · 0 errores · 275 estados truncados 42.0%IC del 95% 39.2–44.6%
  4. Kev-0.8B236/500 correctas · 0 errores · 0 estados truncados 47.2%IC del 95% 42.6–51.8%

Trazas de agentes

Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95%
  1. Reflex-1369/500 correctas · 0 errores · 0 estados truncados 73.8%IC del 95% 69.0–78.4%
  2. Laya · nativa193/500 correctas · 0 errores · 0 estados truncados 38.6%IC del 95% 33.4–44.0%
  3. OpenJev · DeBERTa192/500 correctas · 0 errores · 0 estados truncados 38.4%IC del 95% 34.6–42.2%
  4. Kev-0.8B179/500 correctas · 0 errores · 0 estados truncados 35.8%IC del 95% 31.6–40.4%

Aquí Reflex-1 designa los pesos de desarrollo del 3 de octubre, no la descarga predeterminada ni una versión final. 400 estados fuente reservados se amplían a 2,000 juicios, 500 por flujo. Los intervalos remuestrean estados fuente conservando las cinco cabezas relacionadas. Límites de tokens: Reflex-1: estado 1,024, solicitud 4,096; Laya · nativo: solicitud 512, instrucción/opciones 192; OpenJev · DeBERTa: estado 256, solicitud 512; Kev-0.8B: estado 512, rama con estado 2,048. Acortamientos de instrucciones/opciones en toda la cohorte (no sumables entre gráficos): Laya · nativo 0/2,000. Son recuentos separados de los estados truncados anteriores.

Concordancia con la opción más frecuente del profesor mediante una interfaz común. Son resultados de conjuntos adaptados, no una puntuación oficial de múltiples cabezas.

En la cohorte reservada de CLINC, Reflex-1 respondió correctamente a 3,680/4,490 solicitudes de intención y fuera de alcance (82.0%). En selección de herramientas desconocidas acertó 72/87, por debajo del mejor resultado externo de 82/87. Abajo se muestran fortalezas y limitaciones.

Enrutamiento de intenciones

3 de octubre de 2026 · versión de desarrollo 70a843878214

Solicitudes conocidas y desconocidas

Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95%
  1. Reflex-13,680/4,490 correctas · 0 errores · 0 estados truncados · 64 rechazos incorrectos · 370 aceptaciones incorrectas 82.0%IC del 95% 80.8–83.1%
  2. Laya · nativa1,425/4,490 correctas · 0 errores · 0 estados truncados · 0 rechazos incorrectos · 942 aceptaciones incorrectas 31.7%IC del 95% 30.3–33.2%
  3. Laya · ampliado1,017/4,490 correctas · 0 errores · 0 estados truncados · 0 rechazos incorrectos · 942 aceptaciones incorrectas 22.7%IC del 95% 21.4–23.9%
  4. OpenJev · DeBERTa2,496/4,490 correctas · 0 errores · 0 estados truncados · 5 rechazos incorrectos · 939 aceptaciones incorrectas 55.6%IC del 95% 54.1–57.0%
  5. Kev-0.8B2,298/4,490 correctas · 0 errores · 0 estados truncados · 1 rechazos incorrectos · 937 aceptaciones incorrectas 51.2%IC del 95% 49.6–52.6%

Aquí Reflex-1 designa los pesos de desarrollo del 3 de octubre, no la descarga predeterminada ni una versión final. 4,490 solicitudes reservadas: 3,548 intenciones conocidas y 942 fuera de alcance. Se muestran Laya nativo y su control de contexto ampliado declarado por separado. Límites de tokens: Reflex-1: estado 1,024, solicitud 4,096; Laya · nativo: solicitud 512, instrucción/opciones 192; Laya · ampliado: solicitud 2,048, instrucción/opciones 1,536; OpenJev · DeBERTa: estado 256, solicitud 512; Kev-0.8B: estado 512, rama con estado 2,048. Acortamientos de instrucciones/opciones en toda la cohorte (no sumables entre gráficos): Laya · nativo 4,490/4,490; Laya · ampliado 0/4,490. Son recuentos separados de los estados truncados anteriores.

Reflex-1 enruta correctamente 3,108/3,548 solicitudes conocidas y rechaza 572/942 fuera de alcance. Rechaza por error 64 conocidas y acepta 370 fuera de alcance. Se conservan todas las condiciones externas.

Selección entre herramientas desconocidas

3 de octubre de 2026 · versión de desarrollo 70a843878214

Selección de herramientas

Precisión (%) · cuanto más alto, mejorExactitud · intervalo del 95%
  1. Reflex-172/87 correctas · 0 errores · 0 estados truncados 82.8%IC del 95% 74.7–90.8%
  2. Laya · nativa80/87 correctas · 0 errores · 14 estados truncados 92.0%IC del 95% 86.2–97.7%
  3. Laya · ampliado80/87 correctas · 0 errores · 0 estados truncados 92.0%IC del 95% 86.2–97.7%
  4. OpenJev · DeBERTa82/87 correctas · 0 errores · 30 estados truncados 94.3%IC del 95% 88.5–98.9%
  5. Kev-0.8B81/87 correctas · 0 errores · 1 estados truncados 93.1%IC del 95% 87.4–97.7%

Aquí Reflex-1 designa los pesos de desarrollo del 3 de octubre, no la descarga predeterminada ni una versión final. 87 solicitudes reservadas, con nombres de herramientas y estados normalizados separados antes del entrenamiento. Es una adaptación de elección de herramientas; generar argumentos y ejecutar queda fuera del alcance. Límites de tokens: Reflex-1: estado 1,024, solicitud 4,096; Laya · nativo: solicitud 512, instrucción/opciones 192; Laya · ampliado: solicitud 2,048, instrucción/opciones 1,536; OpenJev · DeBERTa: estado 256, solicitud 512; Kev-0.8B: estado 512, rama con estado 2,048. Acortamientos de instrucciones/opciones en toda la cohorte (no sumables entre gráficos): Laya · nativo 87/87; Laya · ampliado 65/87. Son recuentos separados de los estados truncados anteriores.

Reflex-1 selecciona correctamente 72/87 herramientas. Laya alcanza 80/87 en cada condición declarada, OpenJev 82/87 y Kev 81/87. Se evalúa la elección entre herramientas proporcionadas, no la generación de argumentos ni la ejecución.

Son adaptaciones a opciones comunes con cohortes declaradas, no envíos a clasificaciones oficiales. Los modelos externos se evaluaron tal como se distribuyen, sin el entrenamiento específico de Reflex-1. Las figuras conservan los intervalos de incertidumbre, presupuestos de tokens y recuentos de truncamiento originales.

Velocidad y recursos

Las mediciones de esta sección corresponden al checkpoint del 2 de octubre. Las del checkpoint actual están disponibles en la ficha de modelo enlazada arriba.

Latencia de solicitud del H200

Reproducimos 120 solicitudes distintas dos veces por modelo en una NVIDIA H200 compartida. Procedían de cinco entornos de juego y navegador. Todos los modelos recibieron las mismas entradas, con una solicitud en vuelo a la vez.

Latencia de solicitud del H200

120 entradas · dos repeticiones · una solicitud en vuelo
Milisegundos · cuanto más bajo es más rápidoMediana//p95
  1. Reflex-1FP32 27.5 / 30.5
  2. OpenJevFP32 32.0 / 33.8
  3. Laya (nativa)BF16 27.1 / 142.0
  4. Laya (repetición de FP32)FP32 40.2 / 44.4

Punto: mediana. Final de línea: p95. Incluye la tokenización, la puntuación y el loopback HTTP; excluye la carga y el calentamiento.

120 entradas idénticas, cada una reproducida dos veces, con una solicitud en vuelo. El tiempo incluye el formateo, la tokenización, la inferencia y el HTTP en bucle invertido. Los tramos muestran una mediana de p95. La precisión difiere según la etiqueta; la repetición de Laya del FP32 cambió dos decisiones.
Tabla de medición y protocolo completos
H200 · solicitudes idénticas · latencia en milisegundos · cuanto más bajo, mejor
modeloRecursos de cómputoMedianap95
reflex-1FP3227.530.5
OpenJevFP3232.033.8
Laya (nativa)BF1627.1142.0
Laya (repetición de FP32)FP3240.244.4

Laya native utiliza la transmisión automática BF16; también se incluye una reproducción FP32 independiente. OpenJev es el punto de control público de DeBerta, no el Jev alojado. Estos tiempos de solicitud no miden el éxito de las tareas ni el rendimiento simultáneo. Grabado el 2026-09-29.

La mediana de reflex-1 fue de 27.5 ms y su p95 de 30.5 ms. Fue más rápido que OpenJev en FP32 y que Laya en la medición separada en FP32. La configuración nativa de Laya usó autocast BF16 y obtuvo una mediana ligeramente menor. El equipo compartido y el tamaño de la muestra limitan las conclusiones sobre resultados tan próximos.

El temporizador incluye la tokenización, la puntuación del modelo, la normalización de la salida y el HTTP de bucle invertido. Excluye la carga y tres solicitudes de calentamiento. Las cachés de respuestas y opciones estaban deshabilitadas. No medimos el rendimiento de los servidores simultáneos en esta ejecución. OpenJev aquí es el punto de control público de DeBerta; no es el servicio Jev alojado.

LATENCIA DE LA CPU M4

La prueba de la CPU utilizó un MacBook Air M4, un FP32 y un tamaño de lote uno. Cada modelo utilizó un subproceso intraoperatorio de PyTorch, un subproceso interoperativo y un límite de subprocesos BLAS de uno. Cada tarea tenía 24 casos distintos, cada uno repetido dos veces. El orden del modelo se equilibró en ocho bloques de ejecución.

Latencia de solicitud de CPU M4

FP32 · lote uno · subprocesos de PyTorch 1/1 · límite BLAS 1

Banking77

Milisegundos · escala logarítmica · cuanto más bajo es más rápidoMediana//p95
  1. Reflex-1 345.2 / 692.0
  2. OpenJev 1,332.6 / 2,857.1
  3. Laya 912.4 / 2,649.9
  4. Kev 4,283.4 / 11,073.7

Emotion

Milisegundos · escala logarítmica · cuanto más bajo es más rápidoMediana//p95
  1. Reflex-1 256.2 / 610.4
  2. OpenJev 381.8 / 1,029.5
  3. Laya 240.1 / 427.7
  4. Kev 1,121.9 / 4,422.3

AG News

Milisegundos · escala logarítmica · cuanto más bajo es más rápidoMediana//p95
  1. Reflex-1 321.7 / 578.7
  2. OpenJev 424.5 / 934.0
  3. Laya 324.1 / 760.5
  4. Kev 1,356.5 / 4,997.2

SST-5

Milisegundos · escala logarítmica · cuanto más bajo es más rápidoMediana//p95
  1. Reflex-1 299.1 / 631.0
  2. OpenJev 360.5 / 894.5
  3. Laya 250.7 / 548.5
  4. Kev 902.2 / 4,480.5

BoolQ

Milisegundos · escala logarítmica · cuanto más bajo es más rápidoMediana//p95
  1. Reflex-1 463.4 / 1,329.1
  2. OpenJev 451.9 / 1,398.9
  3. Laya 440.4 / 1,587.9
  4. Kev 1,775.3 / 6,548.0

Punto: mediana. Extremo de la línea: p95. Todas las tareas usan la misma escala logarítmica. Memoria: RSS máximo del proceso de 1.50 GiB en una medición separada de Reflex-1; no se midió la memoria por modelo en esta comparación.

FP32, tamaño de lote uno; PyTorch usa 1/1 hilos intraoperación/interoperación y BLAS se limita a 1 hilo. Estudio de latencia original: 24 entradas por tarea, cada una repetida dos veces. Una medición separada de 240 solicitudes de Reflex-1 registró 1.50 GiB de RSS máximo del proceso, incluyendo carga, calentamiento e inferencia. La comparación original no registró memoria por modelo. Los segmentos van de la mediana al p95. Laya trunca las opciones de Banking77; Kev usa kernels de CPU de referencia con adaptadores sin fusionar.
Tabla de medición y protocolo completos
CPU M4 · FP32 · PyTorch intraop/inter-op 1/1 · Límite BLAS 1 · mediana/p95 en milisegundos
Tareareflex-1OpenJevLayaKev
Banking77345.2/ 692.01332.6/ 2857.1912.4/ 2649.94283.4/ 11073.7
Emotion256.2/ 610.4381.8/ 1029.5240.1/ 427.71121.9/ 4422.3
AG News321.7/ 578.7424.5/ 934.0324.1/ 760.51356.5/ 4997.2
SST-5299.1/ 631.0360.5/ 894.5250.7/ 548.5902.2/ 4480.5
BoolQ463.4/ 1329.1451.9/ 1398.9440.4/ 1587.91775.3/ 6548.0

Presupuestos de tiempo de ejecución nativos. Laya trunca las opciones de Banking77 según su presupuesto original; los resultados del presupuesto ampliado se presentan por separado. Kev usa sus núcleos de referencia de CPU y adaptadores no fusionados. Grabado el 2026-09-24.

Memoria medida por Reflex-1: RSS de procesamiento máximo de 1.50 GiB. Reproducción separada del recurso Reflex-1 de las 120 entradas originales, cada una puntuada dos veces. El RSS máximo de todo el proceso incluye importaciones, carga de modelos, calentamiento e inferencia. La comparación de latencia original de cuatro modelos no registraba la memoria por modelo. Grabado el 2026-10-02 UTC. Mediciones y protocolo de recursos.

Banking77 exige elegir entre 77 intenciones. La mediana de reflex-1 fue de 345.2 ms, frente a 1,332.6 ms de OpenJev en la misma ejecución. En las cinco tareas, las medianas de reflex-1 variaron entre 256.2 y 463.4 ms.

Laya era más rápida en varias tareas de menor envergadura. Su presupuesto original, Banking77, truncaba las opciones, por lo que su calendario cubre un conjunto reducido de candidatos. Kev usó núcleos de referencia de CPU con adaptadores no fusionados. En segundo plano, la actividad de los ordenadores portátiles contribuyó a aumentar las latencias de la cola.

Esta prueba mide desde la construcción de la solicitud hasta la salida normalizada, con el modelo ya cargado. Las pruebas de CPU y GPU usan solicitudes diferentes; sus tiempos no permiten calcular directamente la aceleración de GPU respecto a CPU.

Precisión en tareas conocidas

reflex-1 obtuvo un 95.0% en Banking77 y un 92.2% en Emotion. Lideró los puntos de control comparados en ambos, empató la mejor puntuación en AG News y SST-5, y obtuvo una puntuación ligeramente inferior a OpenJev en BoolQ.

Precisión de las decisiones

500 ejemplos por tarea · diagnósticos de desarrollo

Banking77

Precisión (%) · cuanto más alto, mejorValor registrado
  1. Reflex-1 95.0%
  2. OpenJev 90.6%
  3. Laya · nativa 44.4%
  4. Laya · ampliado 55.4%
  5. Kev 82.4%

Emotion

Precisión (%) · cuanto más alto, mejorValor registrado
  1. Reflex-1 92.2%
  2. OpenJev 53.0%
  3. Laya · nativa 57.6%
  4. Laya · ampliado 57.6%
  5. Kev 54.4%

AG News

Precisión (%) · cuanto más alto, mejorValor registrado
  1. Reflex-1 91.2%
  2. OpenJev 77.4%
  3. Laya · nativa 91.2%
  4. Laya · ampliado 91.2%
  5. Kev 87.2%

SST-5

Precisión (%) · cuanto más alto, mejorValor registrado
  1. Reflex-1 59.8%
  2. OpenJev 59.8%
  3. Laya · nativa 51.0%
  4. Laya · ampliado 51.0%
  5. Kev 55.2%

BoolQ

Precisión (%) · cuanto más alto, mejorValor registrado
  1. Reflex-1 86.0%
  2. OpenJev 86.8%
  3. Laya · nativa 71.2%
  4. Laya · ampliado 71.2%
  5. Kev 82.6%

Las familias de tareas se incluyeron en la capacitación y estos subconjuntos se inspeccionaron durante el desarrollo. La exposición al entrenamiento difiere entre los modelos. El presupuesto nativo de Laya trunca las opciones de Banking77.

Cada modelo recibió los mismos 500 ejemplos por tarea. Estas familias de tareas se incluyeron en el entrenamiento de Reflex y los subconjuntos se inspeccionaron durante el desarrollo. La exposición al entrenamiento difiere según los modelos. Laya, de presupuesto ampliado, conserva las 77 etiquetas de Banking77.
Tabla de medición y protocolo completos
Precisión (%) · 500 ejemplos por tarea · diagnósticos de desarrollo
Tareareflex-1Laya, nativaLaya, ampliadaOpenJevKev
Banking7795.044.455.490.682.4
Emotion92.257.657.653.054.4
AG News91.291.291.277.487.2
SST-559.851.051.059.855.2
BoolQ86.071.271.286.882.6

El SDK 0.3.20 de Laya se muestra con presupuestos de tokens nativos y ampliados. El presupuesto nativo de Banking77 trunca el conjunto de opciones; el presupuesto ampliado conserva las 77 etiquetas. Se trata de diagnósticos de desarrollo, no de evaluaciones de transferencia independientes.

Se trataba de 500 ejemplos de diagnóstico por tarea. Las familias de tareas se incluyeron en la capacitación y inspeccionamos los subconjuntos durante el desarrollo. Los presupuestos de capacitación y la exposición previa difieren entre los modelos. La precisión se midió por separado de la latencia, en más ejemplos.

El punto de control general completó 0 de las 80 pruebas con nuestro controlador de navegador personalizado. El resultado expone una brecha sustancial entre la clasificación de tareas familiares y el control autónomo. La transferencia a preguntas desconocidas y la calibración de probabilidades siguen siendo problemas de evaluación abiertos.

Formación y almacenamiento

El modelo de servicio tiene 420,778,370 parámetros después de combinar los adaptadores. ModernBERT codifica el estado y las preguntas; un codificador MiniLM congelado representa las opciones. La cabecera compartida combina sus representaciones.

reflex-1 · tamaño de la ración y presupuesto de adaptación
RecursoConfiguración grabada
Parámetros de servicio420,778,370
Parámetros entrenados en adaptación9,036,290
Hardware de adaptación1 × NVIDIA H200
Carrera principal6,000 actualizaciones · 75 min 7 seg
Modelo FP32 extraído en disco≈ 1.69 GB
Memoria de proceso de CPU medidaRSS máximo de 1.50 GiB · reproducción separada de 240 solicitudes
Subprocesos de procesamiento de CPUPyTorch intraop/inter-op 1/1 · Límite BLAS 1

La ejecución principal de la adaptación actualizó 9,036,290 parámetros en 6,000 pasos, utilizando 290,657 registros de ocho familias de tareas. Se necesitaron 75 minutos y 7 segundos en un H200, incluidas las pantallas de desarrollo y los puntos de control guardados. El entrenamiento previo del modelo base, la preparación de datos, el ajuste de la proyección y los experimentos anteriores son costos adicionales.

El modelo FP32 extraído ocupa aproximadamente 1.69 GB en disco. La medición separada de recursos de CPU registró 1.50 GiB de RSS máximo del proceso, incluyendo memoria asignada por el framework, tokenizadores, carga, calentamiento e inferencia. El uso de memoria de GPU aún no se ha medido.

Acceso modelo

La versión pública Hugging Face contiene los pesos FP32 de 1.68 GB, ambos tokenizadores y una implementación autónoma de Transformers en Apache 2.0. No se requiere ninguna cuenta, clave de API ni acceso a GitHub. Usa Python 3.12:

python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0"
import torch
from transformers import AutoModel

torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)

decision = model.predict(
    state="The customer was charged twice for one card payment.",
    question="Choose the matching issue.",
    options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)

Cargue el modelo una vez y reutilícelo. La tarjeta modelo documenta la inferencia por lotes, las preguntas múltiples, la carga sin conexión y los hashes de publicación. El repositorio de desarrollo permanece privado; el paquete público incluye el código necesario para la inferencia.

El entrenamiento original utilizó RACE y SciQ, cuyas condiciones incluyen restricciones no comerciales. La ficha del modelo documenta su uso y las versiones fijas. La revisión de procedencia no determina cómo se aplican esas condiciones a los pesos entrenados.

Grabaciones y reproducibilidad

Usa la revisión fija del Hub del 3 de octubre para reproducir estas grabaciones. Los gráficos conservan los resultados medidos, incluidas las pérdidas de capacidades previas. Cada grabación identifica el entorno, el formato de entrada y la velocidad de reproducción.

La versión actual tiene una evaluación independiente enlazada desde su ficha de modelo. Estas grabaciones y estudios conservan sus resultados originales.

También en investigación

  • Samsara-VLA

    Dos políticas robóticas compactas para manipulación guiada por lenguaje. Vea cómo recogen, colocan, abren y completan tareas de varios pasos.

  • VIO-lens-2

    Investigación en curso.

Correspondencia

Escríbenos

Póngase en contacto con nosotros acerca de las evaluaciones, el acceso a modelos o una colaboración de investigación.

research@goodailabs.com