系統
為本地型號選擇硬體
reflex-1 在膝上型電腦的 CPU 和 H200 上執行。請求、延遲目標和執行記憶體決定了哪臺計算機適合該應用。
reflex-1 用了 345.2 ms的中位數才在一個 M4 CPU 執行緒上從 77 個意圖中進行選擇。 另一項H200測試以27.5 ms的中 位數返回了記錄的代理請求,包括本地HTTP。開發人員可以在其中一個上執行模型;應用 的延遲目標決定了哪個結果是相關的。
這些測試的請求有所不同。要為服務選擇硬體,請在預期的並 發度下 測量其實際輸入長度和選項數量。reflex-1 報告記錄了我們測量的條件。
磁碟、記憶體和介面卡
FP32 reflex-1 模型在磁碟上佔用大約 1.69 GB,包含 421M服務引數。 它的主要改編執行訓練了9.04M引數。 因此,儲存、推理和適應有不同的預算。 啟用和框架分配會增加執行時記憶體,同時請求的 數量可能會改變峰值。
Samsara 說明了訓練成本。其217M引數策略是在 八臺H200上訓練的。在執行接近尾聲時,排名為零的記錄了 23.52 GiB 的 峰值分配記憶體。該訓練衡量標準包括梯 度和最佳化器狀態等成本;它沒有指定推理要求。 Samsara 報告給出了設定。
應用程式的其餘部分
檢索、工具執行和日誌記錄也需要硬體。在 本地控制模型輸入的處理位置進行推理,但每個互聯服務 都有自己的資料路徑和資源使用情況。
推理在哪裡執行
01/遠端
外部端點應用程式上下文被髮送到在站點之外執行的模型
請求 → 網路 → 模型提供者操作推理硬體
02/本地
您自己的硬體應用程式上下文由部署在站點的模型處理
請求 → 本地模型該部署提供了其計算和容量
衡量從到達到完成操作的完整請求。模型延 遲是該間隔的一部分;佇列和工具呼叫可能會造成更多延遲。