[↖ 研究日誌](https://www.goodailabs.com/zh-tw/blog/) 系統 # 為本地型號選擇硬體 reflex-1 在膝上型電腦的 CPU 和 H200 上執行。請求、延遲目標和執行記憶體決定了哪臺計算機適合該應用。 Good AI Labs 2026年10月2日 2 分鐘閱讀 在這篇文章中 - [磁碟、記憶體和介面卡](https://www.goodailabs.com/#disk-memory-and-adaptation) - [應用程式的其餘部分](https://www.goodailabs.com/#the-rest-of-the-application) [全部文章 ↗](https://www.goodailabs.com/zh-tw/blog/) reflex-1 用了 345.2 ms的中位數才在一個 M4 CPU 執行緒上從 77 個意圖中進行選擇。 另一項H200測試以27.5 ms的中 位數返回了記錄的代理請求,包括本地HTTP。開發人員可以在其中一個上執行模型;應用 的延遲目標決定了哪個結果是相關的。 這些測試的請求有所不同。要為服務選擇硬體,請在預期的並 發度下 測量其實際輸入長度和選項數量。[reflex-1](https://www.goodailabs.com/zh-tw/research/reflex-1/) 報告記錄了我們測量的條件。 ## 磁碟、記憶體和介面卡 FP32 reflex-1 模型在磁碟上佔用大約 1.69 GB,包含 421M服務引數。 它的主要改編執行訓練了9.04M引數。 因此,儲存、推理和適應有不同的預算。 啟用和框架分配會增加執行時記憶體,同時請求的 數量可能會改變峰值。 Samsara 說明了訓練成本。其217M引數策略是在 八臺H200上訓練的。在執行接近尾聲時,排名為零的記錄了 23.52 GiB 的 峰值分配記憶體。該訓練衡量標準包括梯 度和最佳化器狀態等成本;它沒有指定推理要求。 [Samsara 報告](https://www.goodailabs.com/zh-tw/research/samsara-vla/)給出了設定。 ## 應用程式的其餘部分 檢索、工具執行和日誌記錄也需要硬體。在 本地控制模型輸入的處理位置進行推理,但每個互聯服務 都有自己的資料路徑和資源使用情況。 推理在哪裡執行 01/遠端 外部端點應用程式上下文被髮送到在站點之外執行的模型 請求 → 網路 → 模型提供者操作推理硬體 02/本地 您自己的硬體應用程式上下文由部署在站點的模型處理 請求 → 本地模型該部署提供了其計算和容量 遠端推理將輸入傳送到外部端點。本地推理在應用自己的硬體上執行模型。 衡量從到達到完成操作的完整請求。模型延 遲是該間隔的一部分;佇列和工具呼叫可能會造成更多延遲。 ∎[回到日記 ↗](https://www.goodailabs.com/zh-tw/blog/) 繼續閱讀 [機器人學習四次機器人放置測試↗](https://www.goodailabs.com/zh-tw/blog/four-ways-to-grade-the-same-robot/) [系統為地方決策服務編制預算↗](https://www.goodailabs.com/zh-tw/blog/security-review-is-the-market/)