システム
ローカルモデル用のハードウェアの選択
reflex-1は、H200と同様にラップトップCPUでも動作します。リクエスト、レイテンシーターゲット、ランタイムメモリによって、どのマシンがアプリケーションに適合するかが決まります。
reflex-1は、1つのM4 CPUスレッドで77のインテントから選択するのに中央値345.2 ms かかりました。 別のH200テストでは、ローカルHTTPを含め、 記録されたエージェントリクエストが中央値27.5 ms で返されました。開発者はどちらでもモデルを実行できます。 アプリケーションのレイテンシーターゲットによって、どちらの結果が適切かが決まります。
これらのテストでは要求が異なります。サービスのハードウェアを選択するには、 予想される同時実行数で実際の入力長とオプション数を測定します。reflex-1レポートには、 測定の条件が記録されます。
ディスク、メモリ、アダプテーション
FP32 reflex-1モデルはディスク上で約1.69 GBを占有し、421Mのサービングパラメータを含んでいます。 その主な適応実行では、9.04Mのパラメーターがトレーニングされました。 したがって、ストレージ、推論、および適応には異なる予算があります。 アクティベーションとフレームワーク割り当てはランタイムメモリを増やし、 同時リクエストの数によってピークが変わる可能性があります。
Samsara はトレーニング費用を説明しています。その217Mパラメータポリシーは、 8台のH200でトレーニングされました。ラン終了間際に、ランク0では23.52 GiB ピーク割り当てメモリが記録されました。そのトレーニング測定には、 勾配やオプティマイザーの状態などのコストが含まれていますが、推論要件は指定されていません。 Samsara レポートはその設定を示しています。
アプリケーションの残りの部分
検索、ツール実行、ロギングにもハードウェアが必要です。モデル入力が処理される場所は、 推論をローカルに制御しますが、 接続された各サービスには独自のデータパスとリソースの使用があります。
推論が実行される場所
外部エンドポイントアプリケーションコンテキストは、サイトの外部で実行されているモデルに送信されます
独自のハードウェアアプリケーションコンテキストは、サイトにデプロイされたモデルによって処理されます
到着から処理完了までのリクエスト全体を測定します。モデルレイテンシ はその間隔の一部であり、キューやツールコールがそれ以上を占める場合があります。