JA
お問い合わせ
メニュー
研究ノート

システム

ローカルディシジョンサービスの予算編成

reflex-1のタイミングは、モデルがロードされた状態から始まります。デプロイされたサービスには、起動、キュー、およびツール呼び出しも考慮する必要があります。

reflex-1の27.5 ms のH200中央値には、トークン化、スコアリング、出力正規化、ループバックHTTPが含まれます。 最初に、モデルが読み込まれ、1 つのリクエストが処理されます。キュー、コールドスタート、 またはダウンストリームのツールコールがあるサービスでは、応答時間が異なります。

M4 CPUの結果は、別のワークロードで処理中のリクエストを測定したものです。 Banking77では中央値345.2 ms です。そのタイミングには読み込みも含まれません。 ベンチマークレポートには両方のプロトコルが記載されています。

選択から行動へ

reflex-1 は、アプリケーションによって提供された選択肢の確率を返します。 アプリケーションは選択肢をツールにマップし、 それを実行する権限を確認します。モデルのバージョンと選択可能な選択肢を、 選択した回答と結果のアクションとともに記録します。これにより、 ルーティングエラーと、正しく選択された後に失敗したツールを区別できます。

入力とログには、 アプリケーションの他の部分と同じアクセス制御が必要です。ローカル推論だけでは、 そのツールや検索サービスがデータを送信する場所を決定することはできません。

導入時に測定すべきこと

目的のハードウェアの起動時間と常駐メモリを測定します。次に、 キュー時間やダウンストリーム作業など、予想される同時実行率でのリクエストレイテンシ を測定します。 モデル設定と入力サイズを結果とともに記録します。

現在のreflex-1レポートは、常駐推論とモデルストレージを対象としています。 ピークメモリとアプリケーション全体のレイテンシには、 これらの追加測定が必要です。