Systèmes
Choix du matériel pour un modèle local
le reflex-1 fonctionne sur un CPU d'ordinateur portable ainsi que sur un H200. La demande, la cible de latence et la mémoire d'exécution déterminent la machine adaptée à l'application.
Il a fallu 345.2 ms en médiane à reflex-1 pour sélectionner parmi 77 intentions sur un thread de CPU M4. Un test H200 distinct a renvoyé les demandes d'agent enregistrées en 27.5 ms médiane, y compris le protocole HTTP local. Un développeur peut exécuter le modèle sur l'un ou l'autre ; la cible de latence de l'application détermine le résultat pertinent.
Les demandes diffèrent d'un test à l'autre. Pour choisir le matériel pour un service, mesurez ses longueurs d'entrée réelles et le nombre d'options à la simultanéité attendue. Le rapport reflex-1 enregistre les conditions de nos mesures.
Disque, mémoire et adaptation
Le modèle FP32 reflex-1 occupe environ 1.69 GB sur le disque et contient 421M de paramètres de service. Sa principale course d'adaptation a entraîné 9.04M de paramètres. Le stockage, l'inférence et l'adaptation ont donc des budgets différents. Les activations et les allocations de framework augmentent la mémoire d'exécution, et le nombre de demandes simultanées peut modifier le pic.
Samsara illustre le coût de la entraînement. Sa politique de 217M paramètres a été entraînée sur huit H200. Vers la fin de l'analyse, le rang zéro a enregistré un pic de mémoire allouée de 23.52 GiB. Cette mesure de entraînement inclut des coûts tels que les gradients et l'état de l'optimiseur ; elle ne spécifie pas les exigences en matière d'inférence. Le rapport Samsara donne la configuration.
Le reste de l'application
La récupération, l'exécution des outils et la journalisation nécessitent également du matériel. Conserver les contrôles locaux d'inférence où les entrées du modèle sont traitées, mais chaque service connecté possède son propre chemin de données et sa propre utilisation des ressources.
Où fonctionne l'inférence
Un point de terminaison externe Le contexte de l'application est envoyé à un modèle exécuté en dehors du site
Votre propre matériel Le contexte applicatif est traité par un modèle déployé sur le site
Mesurez l'intégralité de la demande depuis son arrivée jusqu'à l'action terminée. La latence du modèle fait partie de cet intervalle ; les files d'attente et les appels d'outils peuvent en expliquer davantage.