PT
Contato
Menu
Publicações

Engenharia de modelos

Adaptando parâmetros de 9M dentro de um modelo 421M

A principal corrida de adaptação do reflex-1 levou 75 minutos em um H200. Onde estão os parâmetros treináveis e o que esse tempo inclui.

A adaptação principal do reflex-1 atualizou 9,036,290 parâmetros. Após integrar os adaptadores, o modelo de inferência tinha 420,778,370 parâmetros. Os parâmetros treináveis correspondiam a cerca de 2.15% desse total.

A maioria dos parâmetros veio dos codificadores pré-treinados. O ModernBERT representa o estado e a pergunta; o MiniLM congelado representa as respostas candidatas. Uma projeção ajustada conecta as representações. A execução principal treinou adaptadores de rank 16 e uma cabeça de decisão compartilhada.

Os pesos congelados ainda participam da inferência. Eles ocupam memória e realizam cálculos, mesmo que a adaptação não os atualize.

A corrida medida

Usamos 290,657 registros de oito famílias de tarefas e executamos 6,000 atualizações. O loop levou 75 minutos e 7 segundos em uma NVIDIA H200, incluindo telas de desenvolvimento e salvamentos de checkpoint.

Esse tempo exclui o pré-treinamento do modelo básico, downloads, preparação de dados, ajuste de projeção e experimentos anteriores. A corrida produziu um checkpoint com 95.0% de precisão de Banking77 e 92.2% de Emotion em diagnósticos de tarefas familiares. O relatório de desempenho abrange todas as cinco tarefas e os pontos de verificação comparados.

Após a fusão

O modelo FP32 extraído ocupa cerca de 1.69 GB em disco. O serviço ainda precisa de memória para ativações e alocações de estrutura. A fração do adaptador , portanto, descreve o trabalho de adaptação, não a fração do modelo completo necessária em tempo de execução.