JA
お問い合わせ
メニュー
研究ノート

発表

意思決定モデル

Reflex-1 ご紹介

ツールの振り分け、意図分類、行動選択のための 421M パラメータモデル。重みを公開し、CPU 性能を測定しています。

Good AI Labs 5 分で読める

Reflex-1 · オリジナル Chromium43.6 秒 サイレントビデオ
Reflex-1 · Chromium Dino. ネイティブ Chromium Dino で、可視ジオメトリの構造化入力を使う Reflex-1。2026 年 10 月 3 日の開発スナップショットです。独立コースの全編録画は 42.309 秒で衝突して終了し(スコア 535)、60 秒には届きません。推論中もブラウザーは動作します。 通常速度のブラウザー録画。推論中もゲームの時計は進みます。

1 つのパスでさまざまな決定が可能

Reflex-1 は、候補からの選択を行うパラメータ数 421M のモデルです。状態を表すテキスト、質問、回答候補を与えると、一度の順伝播で各候補をスコアリングします。候補はリクエストごとに変更できます。

同じインターフェースで、サポート依頼の振り分け、ツール選択、行動選択を行えます。28 層のコンテキストエンコーダーと六層の候補エンコーダーを共通のスコアリングヘッドに接続しています。選択肢の提示と結果の実行はアプリケーションが担います。

Reflex-1 /意思決定モデル

質問から選択まで。

  1. 01 / 入力

    決定を定義してください。

    アプリケーションは、状態、質問、および処理できる選択肢を提供します。これらの選択肢は、サポートキュー、利用可能なツール、許可されているアクションなど、リクエストのたびに変わる可能性があります。

    都道府県+質問

    お客様には2回請求されました。
    どの問題が一致しますか?

    重複請求カード紛失不明な手数料現金引き出し
    コンテキスト + 質問ModernBERT
    それぞれの選択肢MiniLM
    共有スコアリングヘッド選択確率
    [アプリケーション]権限 → 引数 → アクション
    例示的なサポートリクエスト。アプリケーションが候補セットを定義します。
  2. 02 / エンコード

    コンテキストと候補を代表してください。

    適合した ModernBERT エンコーダが状態と質問を読み取ります。フローズンMiniLMエンコーダは、指定された各選択肢を表します。複数の質問が 1 つのパック状態を共有できます。

    都道府県+質問

    お客様には2回請求されました。
    どの問題が一致しますか?

    重複請求カード紛失不明な手数料現金引き出し
    コンテキスト + 質問ModernBERT
    それぞれの選択肢MiniLM
    共有スコアリングヘッド選択確率
    [アプリケーション]権限 → 引数 → アクション
    2 つのエンコーダが 1 つの共有スコアリングヘッドに給電します。これはプレビューアーキテクチャの概略図です。
  3. 03 / 採点

    1つのパスで与えられたすべての選択肢を採点します。

    共有ヘッドは、コンテキストと候補表現を組み合わせて、指定された選択肢の確率分布を返します。新しい意思決定タイプには、やはり精度テストとキャリブレーションテストが必要です。

    都道府県+質問

    お客様には2回請求されました。
    どの問題が一致しますか?

    重複請求カード紛失不明な手数料現金引き出し
    コンテキスト + 質問ModernBERT
    それぞれの選択肢MiniLM
    共有スコアリングヘッド選択確率
    [アプリケーション]権限 → 引数 → アクション
    指定された候補ごとに 1 つのスコアを、確率分布に正規化します。
  4. 04 / 行動

    決定はアプリケーションに任せてください。

    アプリケーションは、許可するアクションを決定し、任意のツール引数を作成し、選択したアクションを実行します。Reflex-1がスコアを提供し、周囲のシステムが制御ループを所有します。

    都道府県+質問

    お客様には2回請求されました。
    どの問題が一致しますか?

    重複請求カード紛失不明な手数料現金引き出し
    コンテキスト + 質問ModernBERT
    それぞれの選択肢MiniLM
    共有スコアリングヘッド選択確率
    [アプリケーション]権限 → 引数 → アクション
    アプリケーションの境界は重要です。ツールにスコアを付けても、ツールは実行されません。

公開開発プレビューのアーキテクチャ。サポートリクエストには入力形式が示されています。

録画による実例

上の Dino の録画と以下の例は、デフォルトの公開重みとは異なる10 月 3 日のスナップショットを使用しています。実行条件と結果は動画の説明に記載しています。

Reflex-1 · ネイティブ ViZDoom36.5 秒 サイレントビデオ
Reflex-1 · ViZDoom. ネイティブ ViZDoom 1.3.1、Defend the Center、難易度 5 で動く Reflex-1。2026 年 10 月 3 日の開発スナップショットで、事前指定の録画シードは 510001 です。上限 45 秒のうちシミュレーション時間 34.514 秒で死亡し、30 体撃破して終了します。入力は画素ではなく可視エンジンラベルと体力・弾薬です。再生はシミュレーション時間に従い、推論遅延を含みません。 シミュレーション時間に沿って再生し、推論遅延は含めません。元の終了画面の保持は残しています。
Reflex-1 · 合成 WebGym30.1 秒 · 4× サイレントビデオ
レストラン予約 · タスク完了. 10 月 3 日の開発スナップショット。15 行動。Chromium で記録した状態を実時間の 4× で再生し、結末と終了画面の保持を残しています。 ローカルの合成タスク。共通の Qwen3-1.7B テキスト補助モデルを使用。Hub の標準重みとは異なるスナップショットです。

すべての録画と比較を見る。

CPU 推論

現在のチェックポイントを Intel Xeon Platinum 8558 CPU 上で FP32、同時リクエスト数一件として測定しました。各スレッド設定では、新規プロセス二つで 120 入力に対して合計 480 回呼び出しています。トークン化と推論を計時に含めています。

現行モデルの CPU 測定結果

Intel Xeon Platinum 8558 · FP32 · バッチサイズ 1

計算スレッド数:1

レイテンシ · 低いほど高速中央値/p95
  1. AG News 1209.7 / 1385.0 ms
  2. SST-5 973.6 / 1160.3 ms
  3. Emotion 956.9 / 1165.8 ms
  4. Banking77 1101.7 / 1276.9 ms
  5. BoolQ 1600.8 / 2710.6 ms

計算スレッド数:4

レイテンシ · 低いほど高速中央値/p95
  1. AG News 389.5 / 480.4 ms
  2. SST-5 320.6 / 404.2 ms
  3. Emotion 318.8 / 391.0 ms
  4. Banking77 375.2 / 452.1 ms
  5. BoolQ 486.7 / 782.2 ms

各スレッド設定で、新規プロセスを二つ使用し、120 入力に対して 480 回呼び出しました。トークン化と推論を含み、読み込みとウォームアップは除外。共有ホストの評価ランタイムを使用し、リクエスト間キャッシュは無効です。

プロセスのピークメモリは、読み込み、ウォームアップ、推論を含めて 2.17 GiB でした。PyTorch の演算内スレッドを一つまたは四つ、演算間スレッドを一つとし、BLAS も演算内スレッド数に合わせました。実行時の補助スレッドを含む OS スレッド総数は、それぞれ二つと十一でした。

現在の測定と評価。共有ホストの評価ランタイムで測定し、読み込み、ウォームアップ、リクエスト間キャッシュを除外しています。研究ページには以前の M4 と H200 の測定値をチェックポイントの日付とともに掲載しています。

Reflex-1 を試す

重み、トークナイザー、推論コードは Hugging Face で公開しています。アカウントや API キーは不要です。依存パッケージをインストールすると、次のコードを実行できます。

import torch
from transformers import AutoModel

torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)

decision = model.predict(
    state="The customer was charged twice for one card payment.",
    question="Choose the matching issue.",
    options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)

インストール方法、実行時の制限、学習データの利用条件を含むライセンス情報は、モデルカードをご覧ください。

モデル詳細

Reflex-1

ツールの振り分け、意図分類、行動選択のための 421M パラメータモデル。重みを公開し、CPU または GPU で実行できます。