系统
为地方决策服务编制预算
我们的 reflex-1 时序从加载模型开始。部署的服务还需要考虑启动、队列和工具调用。
reflex-1 的 27.5 ms H200 中位数包括代币化、评分、输出标准化和环回 HTTP。 首先,模型已加载完毕, 请求正在运行。具有队列、冷启动或下游工具 调用的服务将具有不同的响应时间。
M4 CPU结果用于衡量单独工作负载下的进程内请求:Banking77的中位数为345.2 ms。它的时机还不包括加载。 基准测试报告提供了两种协议。
从选择到行动
reflex-1 返回的概率高于应用程序提供的选择。 应用程序将选择映射到工具并检查 其执行权限。使用所选 答案和结果操作记录模型版本和可用选择。这使您可以区分路由错误 和在正确选择后失败的工具。
输入和日志需要与 应用程序的其余部分相同的访问控制。仅靠本地推理并不能确定其工具或 检索服务将数据发送到何处。
部署时要衡量什么
测量目标硬件上的启动时间和驻留内存。然后 测量预期并发下的请求延迟,包括排队 时间和下游工作。将模型设置和输入大小与 结果一起记录。
当前的reflex-1报告涵盖了常驻推理和模型存储。 峰值内存和完整的应用延迟需要这些 额外的测量。