系统
为本地型号选择硬件
reflex-1 在笔记本电脑的 CPU 和 H200 上运行。请求、延迟目标和运行内存决定了哪台计算机适合该应用。
reflex-1 用了 345.2 ms的中位数才在一个 M4 CPU 线程上从 77 个意图中进行选择。 另一项H200测试以27.5 ms的中 位数返回了记录的代理请求,包括本地HTTP。开发人员可以在其中一个上运行模型;应用 的延迟目标决定了哪个结果是相关的。
这些测试的请求有所不同。要为服务选择硬件,请在预期的并 发度下 测量其实际输入长度和选项数量。reflex-1 报告记录了我们测量的条件。
磁盘、内存和适配器
FP32 reflex-1 模型在磁盘上占用大约 1.69 GB,包含 421M服务参数。 它的主要改编运行训练了9.04M参数。 因此,存储、推理和适应有不同的预算。 激活和框架分配会增加运行时内存,同时请求的 数量可能会改变峰值。
Samsara 说明了训练成本。其217M参数策略是在 八台H200上训练的。在运行接近尾声时,排名为零的记录了 23.52 GiB 的 峰值分配内存。该训练衡量标准包括梯 度和优化器状态等成本;它没有指定推理要求。 Samsara 报告给出了设置。
应用程序的其余部分
检索、工具执行和日志记录也需要硬件。在 本地控制模型输入的处理位置进行推理,但每个互联服务 都有自己的数据路径和资源使用情况。
推理在哪里运行
01/远程
外部端点应用程序上下文被发送到在站点之外运行的模型
请求 → 网络 → 模型提供者操作推理硬件
02/本地
您自己的硬件应用程序上下文由部署在站点的模型处理
请求 → 本地模型该部署提供了其计算和容量
衡量从到达到完成操作的完整请求。模型延 迟是该间隔的一部分;队列和工具调用可能会造成更多延迟。