ES
Contacto
Menú
Publicaciones

Ingeniería de modelos

Adaptación de 9M de parámetros dentro de un modelo 421M

La adaptación principal de reflex-1 duró 75 minutos en un H200. Dónde se encuentran los parámetros entrenables y qué incluye ese tiempo.

La adaptación principal de reflex-1 actualizó 9,036,290 parámetros. Tras integrar los adaptadores, el modelo de inferencia tenía 420,778,370 parámetros. Los parámetros entrenables representaban aproximadamente el 2.15% del total.

La mayoría de los parámetros procedían de los codificadores preentrenados. ModernBERT representa el estado y la pregunta; MiniLM, congelado, representa las respuestas candidatas. Una proyección ajustada conecta ambas representaciones. La ejecución principal entrenó adaptadores de rango 16 y una cabeza de decisión compartida.

Los pesos congelados aún participan en la inferencia. Ocupan memoria y realizan cálculos aunque la adaptación no los actualice.

La carrera mesurada

Usamos 290,657 registros de ocho familias de tareas y realizamos 6,000 actualizaciones. El ciclo duró 75 minutos y 7 segundos en una NVIDIA H200, incluidas las pantallas de desarrollo y los puntos de control guardados.

Ese calendario excluye el entrenamiento previo del modelo base, las descargas, la preparación de datos, el ajuste de la proyección y los experimentos anteriores. La prueba arrojó un punto de control con una precisión del 95.0% en Banking77 y del 92.2% en Emotion en el diagnóstico de tareas conocidas. El informe de rendimiento cubre las cinco tareas y los puntos de control comparados.

Después de fusionarse

El modelo FP32 extraído ocupa aproximadamente 1.69 GB en disco. El servicio aún necesita memoria para las activaciones y las asignaciones de marcos. Por lo tanto, la fracción del adaptador describe el trabajo de adaptación, no la fracción del modelo completo necesaria en tiempo de ejecución.