[↖ 研究日志](https://www.goodailabs.com/zh-cn/blog/) 系统 # 为本地型号选择硬件 reflex-1 在笔记本电脑的 CPU 和 H200 上运行。请求、延迟目标和运行内存决定了哪台计算机适合该应用。 Good AI Labs 2026年10月2日 2 分钟阅读 在这篇文章中 - [磁盘、内存和适配器](https://www.goodailabs.com/#disk-memory-and-adaptation) - [应用程序的其余部分](https://www.goodailabs.com/#the-rest-of-the-application) [全部文章 ↗](https://www.goodailabs.com/zh-cn/blog/) reflex-1 用了 345.2 ms的中位数才在一个 M4 CPU 线程上从 77 个意图中进行选择。 另一项H200测试以27.5 ms的中 位数返回了记录的代理请求,包括本地HTTP。开发人员可以在其中一个上运行模型;应用 的延迟目标决定了哪个结果是相关的。 这些测试的请求有所不同。要为服务选择硬件,请在预期的并 发度下 测量其实际输入长度和选项数量。[reflex-1](https://www.goodailabs.com/zh-cn/research/reflex-1/) 报告记录了我们测量的条件。 ## 磁盘、内存和适配器 FP32 reflex-1 模型在磁盘上占用大约 1.69 GB,包含 421M服务参数。 它的主要改编运行训练了9.04M参数。 因此,存储、推理和适应有不同的预算。 激活和框架分配会增加运行时内存,同时请求的 数量可能会改变峰值。 Samsara 说明了训练成本。其217M参数策略是在 八台H200上训练的。在运行接近尾声时,排名为零的记录了 23.52 GiB 的 峰值分配内存。该训练衡量标准包括梯 度和优化器状态等成本;它没有指定推理要求。 [Samsara 报告](https://www.goodailabs.com/zh-cn/research/samsara-vla/)给出了设置。 ## 应用程序的其余部分 检索、工具执行和日志记录也需要硬件。在 本地控制模型输入的处理位置进行推理,但每个互联服务 都有自己的数据路径和资源使用情况。 推理在哪里运行 01/远程 外部端点应用程序上下文被发送到在站点之外运行的模型 请求 → 网络 → 模型提供者操作推理硬件 02/本地 您自己的硬件应用程序上下文由部署在站点的模型处理 请求 → 本地模型该部署提供了其计算和容量 远程推理将输入发送到外部端点。本地推理在应用自己的硬件上运行模型。 衡量从到达到完成操作的完整请求。模型延 迟是该间隔的一部分;队列和工具调用可能会造成更多延迟。 ∎[回到日记 ↗](https://www.goodailabs.com/zh-cn/blog/) 继续阅读 [机器人学习四次机器人放置测试↗](https://www.goodailabs.com/zh-cn/blog/four-ways-to-grade-the-same-robot/) [系统为地方决策服务编制预算↗](https://www.goodailabs.com/zh-cn/blog/security-review-is-the-market/)