Sistemas
Orçamento de um serviço de decisão local
Nossos tempos de reflex-1 começam com o modelo carregado. Um serviço implantado também tem inicialização, filas e chamadas de ferramentas para contabilizar.
A mediana H200 de 27.5 ms para o reflex-1 inclui tokenização, pontuação, normalização de saída e HTTP de loopback. Começa com o modelo carregado e uma solicitação em andamento. Um serviço com fila, partidas a frio ou chamadas de ferramentas posteriores terá um tempo de resposta diferente.
O resultado da CPU M4 mede uma solicitação em andamento em uma carga de trabalho separada: mediana de 345.2 ms para Banking77. Seu tempo também exclui o carregamento. O relatório de referência fornece os dois protocolos.
De uma escolha a uma ação
reflex-1 retorna probabilidades sobre as escolhas fornecidas pelo aplicativo. O aplicativo mapeia uma opção para uma ferramenta e verifica a permissão para executá-la. Registre a versão do modelo e as opções disponíveis com a resposta selecionada e a ação resultante. Isso permite distinguir um erro de roteamento de uma ferramenta que falhou após ser selecionada corretamente.
As entradas e os registros precisam dos mesmos controles de acesso do resto do aplicativo. A inferência local por si só não determina para onde suas ferramentas ou serviços de recuperação enviam dados.
O que medir na implantação
Meça o tempo de inicialização e a memória residente no hardware pretendido. Em seguida, meça a latência da solicitação de acordo com a simultaneidade esperada, incluindo o tempo de fila e o trabalho posterior. Registre as configurações do modelo e os tamanhos de entrada com o resultado.
O relatório reflex-1 atual abrange a inferência de residentes e o armazenamento de modelos. O pico de memória e a latência total do aplicativo exigem essas medidas adicionais .