Sistemas
Escolhendo hardware para um modelo local
O reflex-1 é executado em uma CPU de laptop e também em um H200. A solicitação, o alvo de latência e a memória de tempo de execução determinam qual máquina se encaixa no aplicativo.
O reflex-1 levou uma mediana de 345.2 ms para selecionar entre 77 intenções em um thread de CPU M4. Um teste H200 separado retornou solicitações registradas do agente em uma mediana de 27.5 ms, incluindo HTTP local. Um desenvolvedor pode executar o modelo em qualquer um deles; a meta de latência do aplicativo determina qual resultado é relevante.
As solicitações diferem entre esses testes. Para escolher o hardware para um serviço, meça seus comprimentos reais de entrada e as contagens de opções na simultaneidade esperada . O relatório reflex-1 registra as condições de nossas medições.
Disco, memória e adaptação
O modelo FP32 reflex-1 ocupa cerca de 1.69 GB em disco e contém 421M de parâmetros de serviço. Sua principal execução de adaptação treinou 9.04M de parâmetros. Armazenamento, inferência e adaptação, portanto, têm orçamentos diferentes. Ativações e alocações de estrutura aumentam a memória de tempo de execução, e o número de solicitações simultâneas pode alterar o pico.
Samsara ilustra o custo do treinamento. Sua política de 217M de parâmetros foi treinada em oito H200. Perto do final da execução, a classificação zero registrou um pico de 23.52 GiB de memória alocada. Essa medição de treinamento inclui custos como gradientes e estado do otimizador; ela não especifica os requisitos de inferência. O relatório Samsara fornece a configuração.
O resto do aplicativo
A recuperação, a execução da ferramenta e o registro também precisam de hardware. Manter os controles locais de inferência onde as entradas do modelo são processadas, mas cada serviço conectado tem seu próprio caminho de dados e uso de recursos.
Onde ocorre a inferência
Um endpoint externo O contexto do aplicativo é enviado para um modelo em execução fora do site
Seu próprio contexto de aplicativo de hardware é processado por um modelo implantado no site
Meça a solicitação completa desde a chegada até a conclusão da ação. A latência do modelo é uma parte desse intervalo; filas e chamadas de ferramentas podem ser responsáveis por mais.