繁
聯絡
選單
研究日誌

系統

為本地型號選擇硬體

reflex-1 在膝上型電腦的 CPU 和 H200 上執行。請求、延遲目標和執行記憶體決定了哪臺計算機適合該應用。

reflex-1 用了 345.2 ms的中位數才在一個 M4 CPU 執行緒上從 77 個意圖中進行選擇。 另一項H200測試以27.5 ms的中 位數返回了記錄的代理請求,包括本地HTTP。開發人員可以在其中一個上執行模型;應用 的延遲目標決定了哪個結果是相關的。

這些測試的請求有所不同。要為服務選擇硬體,請在預期的並 發度下 測量其實際輸入長度和選項數量。reflex-1 報告記錄了我們測量的條件。

磁碟、記憶體和介面卡

FP32 reflex-1 模型在磁碟上佔用大約 1.69 GB,包含 421M服務引數。 它的主要改編執行訓練了9.04M引數。 因此,儲存、推理和適應有不同的預算。 啟用和框架分配會增加執行時記憶體,同時請求的 數量可能會改變峰值。

Samsara 說明了訓練成本。其217M引數策略是在 八臺H200上訓練的。在執行接近尾聲時,排名為零的記錄了 23.52 GiB 的 峰值分配記憶體。該訓練衡量標準包括梯 度和最佳化器狀態等成本;它沒有指定推理要求。 Samsara 報告給出了設定。

應用程式的其餘部分

檢索、工具執行和日誌記錄也需要硬體。在 本地控制模型輸入的處理位置進行推理,但每個互聯服務 都有自己的資料路徑和資源使用情況。

推理在哪裡執行

01/遠端

外部端點應用程式上下文被髮送到在站點之外執行的模型

請求 → 網路 → 模型提供者操作推理硬體
02/本地

您自己的硬體應用程式上下文由部署在站點的模型處理

請求 → 本地模型該部署提供了其計算和容量
遠端推理將輸入傳送到外部端點。本地推理在應用自己的硬體上執行模型。

衡量從到達到完成操作的完整請求。模型延 遲是該間隔的一部分;佇列和工具呼叫可能會造成更多延遲。