FR
Contact
Menu
Publications

Systèmes

Budgétisation d'un service de décision local

Nos chronométrages du reflex-1 commencent lorsque le modèle est chargé. Un service déployé doit également prendre en compte le démarrage, les files d'attente et les appels d'outils.

La médiane H200 de 27.5 ms pour le reflex-1 inclut la tokenisation, la notation, la normalisation de la sortie et le HTTP en boucle. Cela commence avec le modèle chargé et une demande en vol. Un service comportant une file d'attente, des démarrages à froid ou des appels d'outils en aval aura un temps de réponse différent.

Le résultat du CPU M4 mesure une demande en cours sur une charge de travail distincte : 345.2 ms médiane pour Banking77. Son calendrier exclut également le chargement. Le rapport de référence présente les deux protocoles.

D'un choix à une action

reflex-1 renvoie des probabilités sur les choix fournis par l'application. L'application associe un choix à un outil et vérifie les autorisations nécessaires pour l' exécuter. Enregistrez la version du modèle et les choix disponibles avec la réponse sélectionnée et l'action qui en résulte. Cela vous permet de distinguer une erreur de routage d'un outil qui a échoué après avoir été correctement sélectionné.

Les entrées et les journaux nécessitent les mêmes contrôles d'accès que le reste de l' application. L'inférence locale à elle seule ne permet pas de déterminer où ses outils ou ses services de récupération envoient les données.

Ce qu'il faut mesurer lors du déploiement

Mesurez le temps de démarrage et la mémoire résidente sur le matériel prévu. Mesurez ensuite la latence des demandes dans le cadre de la simultanéité attendue, y compris le temps d'attente et le travail en aval. Enregistrez les paramètres du modèle et les tailles d'entrée avec le résultat.

Le rapport reflex-1 actuel couvre l'inférence résidente et le stockage des modèles. La mémoire maximale et la latence complète de l'application nécessitent ces mesures supplémentaires.