[↖ Publicações](https://www.goodailabs.com/pt/blog/) Sistemas # Orçamento de um serviço de decisão local Nossos tempos de reflex-1 começam com o modelo carregado. Um serviço implantado também tem inicialização, filas e chamadas de ferramentas para contabilizar. Good AI Labs 2 de outubro de 2026 2 min de leitura NESTE ARTIGO - [De uma escolha a uma ação](https://www.goodailabs.com/#from-a-choice-to-an-action) - [O que medir na implantação](https://www.goodailabs.com/#what-to-measure-in-deployment) [Todas as publicações ↗](https://www.goodailabs.com/pt/blog/) A mediana H200 de 27.5 ms para o reflex-1 inclui tokenização, pontuação, normalização de saída e HTTP de loopback. Começa com o modelo carregado e uma solicitação em andamento. Um serviço com fila, partidas a frio ou chamadas de ferramentas posteriores terá um tempo de resposta diferente. O resultado da CPU M4 mede uma solicitação em andamento em uma carga de trabalho separada: mediana de 345.2 ms para Banking77. Seu tempo também exclui o carregamento. O [relatório de referência](https://www.goodailabs.com/pt/research/reflex-1/) fornece os dois protocolos. ## De uma escolha a uma ação reflex-1 retorna probabilidades sobre as escolhas fornecidas pelo aplicativo. O aplicativo mapeia uma opção para uma ferramenta e verifica a permissão para executá-la. Registre a versão do modelo e as opções disponíveis com a resposta selecionada e a ação resultante. Isso permite distinguir um erro de roteamento de uma ferramenta que falhou após ser selecionada corretamente. As entradas e os registros precisam dos mesmos controles de acesso do resto do aplicativo. A inferência local por si só não determina para onde suas ferramentas ou serviços de recuperação enviam dados. ## O que medir na implantação Meça o tempo de inicialização e a memória residente no hardware pretendido. Em seguida, meça a latência da solicitação de acordo com a simultaneidade esperada, incluindo o tempo de fila e o trabalho posterior. Registre as configurações do modelo e os tamanhos de entrada com o resultado. O relatório reflex-1 atual abrange a inferência de residentes e o armazenamento de modelos. O pico de memória e a latência total do aplicativo exigem essas medidas adicionais . ∎[Voltar ao diário ↗](https://www.goodailabs.com/pt/blog/) Continuar lendo [SistemasEscolhendo hardware para um modelo local↗](https://www.goodailabs.com/pt/blog/sovereign-intelligence/) [Engenharia de modelosAdaptando parâmetros de 9M dentro de um modelo 421M↗](https://www.goodailabs.com/pt/blog/debugging-by-decomposition/)