ES
Contacto
Menú
Publicaciones

Sistemas

Presupuestación de un servicio de toma de decisiones local

Nuestros tiempos de reflex-1 comienzan con el modelo cargado. Un servicio implementado también tiene que tener en cuenta las llamadas de inicio, colas y herramientas.

La mediana H200 de 27.5 ms para el reflex-1 incluye la tokenización, la puntuación, la normalización de la salida y el HTTP en bucle invertido. Comienza con el modelo cargado y una solicitud en vuelo. Un servicio con una cola, arranques en frío o llamadas a herramientas posteriores tendrá un tiempo de respuesta diferente.

El resultado de la CPU M4 mide una solicitud en proceso en una carga de trabajo independiente: una mediana de 345.2 ms para Banking77. Su temporización también excluye la carga. El informe de referencia ofrece ambos protocolos.

De una elección a una acción

reflex-1 devuelve probabilidades sobre las opciones ofrecidas por la aplicación. La aplicación asigna una opción a una herramienta y comprueba el permiso para ejecutarla. Registre la versión del modelo y las opciones disponibles con la respuesta seleccionada y la acción resultante. Esto le permite distinguir un error de enrutamiento de una herramienta que falló después de seleccionarse correctamente.

Las entradas y los registros necesitan los mismos controles de acceso que el resto de la aplicación. La inferencia local por sí sola no determina a dónde envían los datos sus herramientas o servicios de recuperación.

Qué medir durante la implementación

Mida el tiempo de inicio y la memoria residente en el hardware deseado. A continuación, mida la latencia de las solicitudes en función de la simultaneidad esperada, incluido el tiempo de espera y el trabajo posterior. Registre la configuración del modelo y los tamaños de entrada con el resultado.

El informe reflex-1 actual cubre la inferencia de los residentes y el almacenamiento de modelos. Los picos de memoria y la latencia total de las aplicaciones requieren estas mediciones adicionales.