[↖ 研究ノート](https://www.goodailabs.com/ja/blog/) 発表 2026年10月5日 意思決定モデル # Reflex-1 ご紹介 ツールの振り分け、意図分類、行動選択のための 421M パラメータモデル。重みを公開し、CPU 性能を測定しています。 Good AI Labs · 5 分で読める [モデルと評価 ↗](https://www.goodailabs.com/ja/research/reflex-1/) [ウェイトとコード ↗](https://huggingface.co/gai-labs/reflex-1)[リリースの結果 ↗](https://www.goodailabs.com/ja/research/reflex-1/#current-results) Reflex-1 · オリジナル Chromium43.6 秒 · サイレントビデオ [見る:Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-002-clean.mp4). Reflex-1 · Chromium Dino. ネイティブ Chromium Dino で、可視ジオメトリの構造化入力を使う Reflex-1。2026 年 10 月 3 日の開発スナップショットです。独立コースの全編録画は 42.309 秒で衝突して終了し(スコア 535)、60 秒には届きません。推論中もブラウザーは動作します。 通常速度のブラウザー録画。推論中もゲームの時計は進みます。 この記事で[モデル](https://www.goodailabs.com/#one-pass-many-possible-decisions)[実例](https://www.goodailabs.com/#recorded-examples)[CPU 推論](https://www.goodailabs.com/#cpu-inference)[Reflex-1 を試す](https://www.goodailabs.com/#try-reflex-1) ## 1 つのパスでさまざまな決定が可能 Reflex-1 は、候補からの選択を行うパラメータ数 421M のモデルです。状態を表すテキスト、質問、回答候補を与えると、一度の順伝播で各候補をスコアリングします。候補はリクエストごとに変更できます。 同じインターフェースで、サポート依頼の振り分け、ツール選択、行動選択を行えます。28 層のコンテキストエンコーダーと六層の候補エンコーダーを共通のスコアリングヘッドに接続しています。選択肢の提示と結果の実行はアプリケーションが担います。 Reflex-1 /意思決定モデル ### 質問から選択まで。 - 01 / 入力 #### 決定を定義してください。 アプリケーションは、状態、質問、および処理できる選択肢を提供します。これらの選択肢は、サポートキュー、利用可能なツール、許可されているアクションなど、リクエストのたびに変わる可能性があります。 都道府県+質問 お客様には2回請求されました。 どの問題が一致しますか? 重複請求カード紛失不明な手数料現金引き出し ↓ コンテキスト + 質問ModernBERT それぞれの選択肢MiniLM ↓ 共有スコアリングヘッド選択確率 ↓ [アプリケーション]権限 → 引数 → アクション 例示的なサポートリクエスト。アプリケーションが候補セットを定義します。 - 02 / エンコード #### コンテキストと候補を代表してください。 適合した ModernBERT エンコーダが状態と質問を読み取ります。フローズンMiniLMエンコーダは、指定された各選択肢を表します。複数の質問が 1 つのパック状態を共有できます。 都道府県+質問 お客様には2回請求されました。 どの問題が一致しますか? 重複請求カード紛失不明な手数料現金引き出し ↓ コンテキスト + 質問ModernBERT それぞれの選択肢MiniLM ↓ 共有スコアリングヘッド選択確率 ↓ [アプリケーション]権限 → 引数 → アクション 2 つのエンコーダが 1 つの共有スコアリングヘッドに給電します。これはプレビューアーキテクチャの概略図です。 - 03 / 採点 #### 1つのパスで与えられたすべての選択肢を採点します。 共有ヘッドは、コンテキストと候補表現を組み合わせて、指定された選択肢の確率分布を返します。新しい意思決定タイプには、やはり精度テストとキャリブレーションテストが必要です。 都道府県+質問 お客様には2回請求されました。 どの問題が一致しますか? 重複請求カード紛失不明な手数料現金引き出し ↓ コンテキスト + 質問ModernBERT それぞれの選択肢MiniLM ↓ 共有スコアリングヘッド選択確率 ↓ [アプリケーション]権限 → 引数 → アクション 指定された候補ごとに 1 つのスコアを、確率分布に正規化します。 - 04 / 行動 #### 決定はアプリケーションに任せてください。 アプリケーションは、許可するアクションを決定し、任意のツール引数を作成し、選択したアクションを実行します。Reflex-1がスコアを提供し、周囲のシステムが制御ループを所有します。 都道府県+質問 お客様には2回請求されました。 どの問題が一致しますか? 重複請求カード紛失不明な手数料現金引き出し ↓ コンテキスト + 質問ModernBERT それぞれの選択肢MiniLM ↓ 共有スコアリングヘッド選択確率 ↓ [アプリケーション]権限 → 引数 → アクション アプリケーションの境界は重要です。ツールにスコアを付けても、ツールは実行されません。 公開開発プレビューのアーキテクチャ。サポートリクエストには入力形式が示されています。 ## 録画による実例 上の Dino の録画と以下の例は、デフォルトの公開重みとは異なる[10 月 3 日のスナップショット](https://huggingface.co/gai-labs/reflex-1/tree/ae50bf81cddcaaac2aa18021d862433ca69da197)を使用しています。実行条件と結果は動画の説明に記載しています。 Reflex-1 · ネイティブ ViZDoom36.5 秒 · サイレントビデオ [見る:Reflex-1 · ViZDoom (MP4)](https://www.goodailabs.com/media/reflex-1/preview/vizdoom-510001-clean.mp4). Reflex-1 · ViZDoom. ネイティブ ViZDoom 1.3.1、Defend the Center、難易度 5 で動く Reflex-1。2026 年 10 月 3 日の開発スナップショットで、事前指定の録画シードは 510001 です。上限 45 秒のうちシミュレーション時間 34.514 秒で死亡し、30 体撃破して終了します。入力は画素ではなく可視エンジンラベルと体力・弾薬です。再生はシミュレーション時間に従い、推論遅延を含みません。 シミュレーション時間に沿って再生し、推論遅延は含めません。元の終了画面の保持は残しています。 Reflex-1 · 合成 WebGym30.1 秒 · 4× · サイレントビデオ [見る:レストラン予約 · タスク完了 (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-restaurant-960000-clean.mp4). レストラン予約 · タスク完了. 10 月 3 日の開発スナップショット。15 行動。Chromium で記録した状態を実時間の 4× で再生し、結末と終了画面の保持を残しています。 ローカルの合成タスク。共通の Qwen3-1.7B テキスト補助モデルを使用。Hub の標準重みとは異なるスナップショットです。 [すべての録画と比較を見る](https://www.goodailabs.com/ja/research/reflex-1/#examples)。 ## CPU 推論 現在のチェックポイントを Intel Xeon Platinum 8558 CPU 上で FP32、同時リクエスト数一件として測定しました。各スレッド設定では、新規プロセス二つで 120 入力に対して合計 480 回呼び出しています。トークン化と推論を計時に含めています。 現行モデルの CPU 測定結果 Intel Xeon Platinum 8558 · FP32 · バッチサイズ 1 計算スレッド数:1 レイテンシ · 低いほど高速中央値/p95 - AG News 1209.7 / 1385.0 ms - SST-5 973.6 / 1160.3 ms - Emotion 956.9 / 1165.8 ms - Banking77 1101.7 / 1276.9 ms - BoolQ 1600.8 / 2710.6 ms 01,5003,000 ms 計算スレッド数:4 レイテンシ · 低いほど高速中央値/p95 - AG News 389.5 / 480.4 ms - SST-5 320.6 / 404.2 ms - Emotion 318.8 / 391.0 ms - Banking77 375.2 / 452.1 ms - BoolQ 486.7 / 782.2 ms 01,5003,000 ms 各スレッド設定で、新規プロセスを二つ使用し、120 入力に対して 480 回呼び出しました。トークン化と推論を含み、読み込みとウォームアップは除外。共有ホストの評価ランタイムを使用し、リクエスト間キャッシュは無効です。 プロセスのピークメモリは、読み込み、ウォームアップ、推論を含めて 2.17 GiB でした。PyTorch の演算内スレッドを一つまたは四つ、演算間スレッドを一つとし、BLAS も演算内スレッド数に合わせました。実行時の補助スレッドを含む OS スレッド総数は、それぞれ二つと十一でした。 [現在の測定と評価](https://huggingface.co/gai-labs/reflex-1/blob/84c2cd49d31f73544e1e17539092056e741e7f03/evaluation.json)。共有ホストの評価ランタイムで測定し、読み込み、ウォームアップ、リクエスト間キャッシュを除外しています。研究ページには[以前の M4 と H200 の測定値](https://www.goodailabs.com/ja/research/reflex-1/#speed-and-resources)をチェックポイントの日付とともに掲載しています。 ## Reflex-1 を試す 重み、トークナイザー、推論コードは [Hugging Face](https://huggingface.co/gai-labs/reflex-1) で公開しています。アカウントや API キーは不要です。依存パッケージをインストールすると、次のコードを実行できます。 ``` import torch from transformers import AutoModel torch.set_num_threads(1) model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True) decision = model.predict( state="The customer was charged twice for one card payment.", question="Choose the matching issue.", options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"], )[0] print(decision.choice) ``` インストール方法、実行時の制限、学習データの利用条件を含むライセンス情報は、[モデルカード](https://huggingface.co/gai-labs/reflex-1)をご覧ください。 [モデル詳細 ## Reflex-1 ツールの振り分け、意図分類、行動選択のための 421M パラメータモデル。重みを公開し、CPU または GPU で実行できます。 ↗](https://www.goodailabs.com/ja/research/reflex-1/) [研究室のその他の情報 ↗](https://www.goodailabs.com/ja/blog/)