[↖ Publicaciones](https://www.goodailabs.com/es/blog/) Sistemas # Presupuestación de un servicio de toma de decisiones local Nuestros tiempos de reflex-1 comienzan con el modelo cargado. Un servicio implementado también tiene que tener en cuenta las llamadas de inicio, colas y herramientas. Good AI Labs 2 de octubre de 2026 2 minutos de lectura EN ESTE ARTÍCULO - [De una elección a una acción](https://www.goodailabs.com/#from-a-choice-to-an-action) - [Qué medir durante la implementación](https://www.goodailabs.com/#what-to-measure-in-deployment) [Todas las publicaciones ↗](https://www.goodailabs.com/es/blog/) La mediana H200 de 27.5 ms para el reflex-1 incluye la tokenización, la puntuación, la normalización de la salida y el HTTP en bucle invertido. Comienza con el modelo cargado y una solicitud en vuelo. Un servicio con una cola, arranques en frío o llamadas a herramientas posteriores tendrá un tiempo de respuesta diferente. El resultado de la CPU M4 mide una solicitud en proceso en una carga de trabajo independiente: una mediana de 345.2 ms para Banking77. Su temporización también excluye la carga. El [informe de referencia](https://www.goodailabs.com/es/research/reflex-1/) ofrece ambos protocolos. ## De una elección a una acción reflex-1 devuelve probabilidades sobre las opciones ofrecidas por la aplicación. La aplicación asigna una opción a una herramienta y comprueba el permiso para ejecutarla. Registre la versión del modelo y las opciones disponibles con la respuesta seleccionada y la acción resultante. Esto le permite distinguir un error de enrutamiento de una herramienta que falló después de seleccionarse correctamente. Las entradas y los registros necesitan los mismos controles de acceso que el resto de la aplicación. La inferencia local por sí sola no determina a dónde envían los datos sus herramientas o servicios de recuperación. ## Qué medir durante la implementación Mida el tiempo de inicio y la memoria residente en el hardware deseado. A continuación, mida la latencia de las solicitudes en función de la simultaneidad esperada, incluido el tiempo de espera y el trabajo posterior. Registre la configuración del modelo y los tamaños de entrada con el resultado. El informe reflex-1 actual cubre la inferencia de los residentes y el almacenamiento de modelos. Los picos de memoria y la latencia total de las aplicaciones requieren estas mediciones adicionales. ∎[Volver al diario ↗](https://www.goodailabs.com/es/blog/) Seguir leyendo [SistemasElección del hardware para un modelo local↗](https://www.goodailabs.com/es/blog/sovereign-intelligence/) [Ingeniería de modelosAdaptación de 9M de parámetros dentro de un modelo 421M↗](https://www.goodailabs.com/es/blog/debugging-by-decomposition/)