ES
Contacto
Menú
Publicaciones

Sistemas

Elección del hardware para un modelo local

La reflex-1 funciona tanto en una CPU portátil como en una H200. La solicitud, el objetivo de latencia y la memoria de tiempo de ejecución determinan qué máquina se ajusta a la aplicación.

reflex-1 tardó una mediana de 345.2 ms en seleccionar entre 77 intentos en un subproceso de CPU M4. Una prueba H200 independiente arrojó las solicitudes de los agentes registradas en una mediana de 27.5 ms, incluido el HTTP local. Un desarrollador puede ejecutar el modelo en cualquiera de los dos; el objetivo de latencia de la aplicación determina qué resultado es relevante.

Las solicitudes difieren entre estas pruebas. Para elegir el hardware de un servicio, mida las longitudes de entrada reales y el recuento de opciones en la concurrencia esperada. El informe reflex-1 registra las condiciones de nuestras mediciones.

Disco, memoria y adaptación

El modelo FP32 reflex-1 ocupa aproximadamente 1.69 GB en disco y contiene 421M de parámetros de servicio. Su principal carrera de adaptación entrenó 9.04M de parámetros. Por lo tanto, el almacenamiento, la inferencia y la adaptación tienen presupuestos diferentes. Las activaciones y las asignaciones de marcos aumentan la memoria de ejecución, y la cantidad de solicitudes simultáneas puede cambiar el pico.

Samsara ilustra el costo de la capacitación. Su política de 217M de parámetros se utilizó en ocho H200. Cerca del final de la ejecución, el rango cero registró un máximo de 23.52 GiB de memoria asignada. Esa medición de la capacitación incluye costos como los gradientes y el estado del optimizador; no especifica los requisitos de inferencia. El informe de Samsara proporciona la configuración.

El resto de la aplicación

La recuperación, la ejecución de herramientas y el registro también necesitan hardware. Mantener los controles locales de inferencia donde se procesan las entradas del modelo, pero cada servicio conectado tiene su propia ruta de datos y uso de recursos.

Dónde se ejecuta la inferencia

01/Control remoto

Un punto final externo El contexto de la aplicación se envía a un modelo que se ejecuta fuera del sitio

Solicitud → red → modeloEl proveedor opera el hardware de inferencia
02/Local

Su propio hardware: el contexto de la aplicación se procesa mediante un modelo implementado en el sitio

Solicitud → modelo localLa implementación proporciona su computación y capacidad
La inferencia remota envía entradas a un punto final externo. La inferencia local ejecuta el modelo en el propio hardware de la aplicación.

Mida la solicitud completa desde la llegada hasta la acción completada. La latencia del modelo es una parte de ese intervalo; es posible que las colas y las llamadas a las herramientas representen más.