[↖ 研究ノート](https://www.goodailabs.com/ja/blog/) システム # ローカルディシジョンサービスの予算編成 reflex-1のタイミングは、モデルがロードされた状態から始まります。デプロイされたサービスには、起動、キュー、およびツール呼び出しも考慮する必要があります。 Good AI Labs 2026年10月2日 読了時間:2 分 この記事で - [選択から行動へ](https://www.goodailabs.com/#from-a-choice-to-an-action) - [導入時に測定すべきこと](https://www.goodailabs.com/#what-to-measure-in-deployment) [すべての記事 ↗](https://www.goodailabs.com/ja/blog/) reflex-1の27.5 ms のH200中央値には、トークン化、スコアリング、出力正規化、ループバックHTTPが含まれます。 最初に、モデルが読み込まれ、1 つのリクエストが処理されます。キュー、コールドスタート、 またはダウンストリームのツールコールがあるサービスでは、応答時間が異なります。 M4 CPUの結果は、別のワークロードで処理中のリクエストを測定したものです。 Banking77では中央値345.2 ms です。そのタイミングには読み込みも含まれません。 [ベンチマークレポートには両方のプロトコルが記載されています](https://www.goodailabs.com/ja/research/reflex-1/)。 ## 選択から行動へ reflex-1 は、アプリケーションによって提供された選択肢の確率を返します。 アプリケーションは選択肢をツールにマップし、 それを実行する権限を確認します。モデルのバージョンと選択可能な選択肢を、 選択した回答と結果のアクションとともに記録します。これにより、 ルーティングエラーと、正しく選択された後に失敗したツールを区別できます。 入力とログには、 アプリケーションの他の部分と同じアクセス制御が必要です。ローカル推論だけでは、 そのツールや検索サービスがデータを送信する場所を決定することはできません。 ## 導入時に測定すべきこと 目的のハードウェアの起動時間と常駐メモリを測定します。次に、 キュー時間やダウンストリーム作業など、予想される同時実行率でのリクエストレイテンシ を測定します。 モデル設定と入力サイズを結果とともに記録します。 現在のreflex-1レポートは、常駐推論とモデルストレージを対象としています。 ピークメモリとアプリケーション全体のレイテンシには、 これらの追加測定が必要です。 ∎[ジャーナルに戻る ↗](https://www.goodailabs.com/ja/blog/) 読み続けて [システムローカルモデル用のハードウェアの選択↗](https://www.goodailabs.com/ja/blog/sovereign-intelligence/) [モデルエンジニアリング421M モデル内の 9M パラメーターの調整↗](https://www.goodailabs.com/ja/blog/debugging-by-decomposition/)