简
联系
菜单
研究日志

系统

为本地型号选择硬件

reflex-1 在笔记本电脑的 CPU 和 H200 上运行。请求、延迟目标和运行内存决定了哪台计算机适合该应用。

reflex-1 用了 345.2 ms的中位数才在一个 M4 CPU 线程上从 77 个意图中进行选择。 另一项H200测试以27.5 ms的中 位数返回了记录的代理请求,包括本地HTTP。开发人员可以在其中一个上运行模型;应用 的延迟目标决定了哪个结果是相关的。

这些测试的请求有所不同。要为服务选择硬件,请在预期的并 发度下 测量其实际输入长度和选项数量。reflex-1 报告记录了我们测量的条件。

磁盘、内存和适配器

FP32 reflex-1 模型在磁盘上占用大约 1.69 GB,包含 421M服务参数。 它的主要改编运行训练了9.04M参数。 因此,存储、推理和适应有不同的预算。 激活和框架分配会增加运行时内存,同时请求的 数量可能会改变峰值。

Samsara 说明了训练成本。其217M参数策略是在 八台H200上训练的。在运行接近尾声时,排名为零的记录了 23.52 GiB 的 峰值分配内存。该训练衡量标准包括梯 度和优化器状态等成本;它没有指定推理要求。 Samsara 报告给出了设置。

应用程序的其余部分

检索、工具执行和日志记录也需要硬件。在 本地控制模型输入的处理位置进行推理,但每个互联服务 都有自己的数据路径和资源使用情况。

推理在哪里运行

01/远程

外部端点应用程序上下文被发送到在站点之外运行的模型

请求 → 网络 → 模型提供者操作推理硬件
02/本地

您自己的硬件应用程序上下文由部署在站点的模型处理

请求 → 本地模型该部署提供了其计算和容量
远程推理将输入发送到外部端点。本地推理在应用自己的硬件上运行模型。

衡量从到达到完成操作的完整请求。模型延 迟是该间隔的一部分;队列和工具调用可能会造成更多延迟。