意思決定モデル
Reflex-1 ご紹介
ツールの振り分け、意図分類、行動選択のための 421M パラメータモデル。重みを公開し、CPU 性能を測定しています。
1 つのパスでさまざまな決定が可能
Reflex-1 は、候補からの選択を行うパラメータ数 421M のモデルです。状態を表すテキスト、質問、回答候補を与えると、一度の順伝播で各候補をスコアリングします。候補はリクエストごとに変更できます。
同じインターフェースで、サポート依頼の振り分け、ツール選択、行動選択を行えます。28 層のコンテキストエンコーダーと六層の候補エンコーダーを共通のスコアリングヘッドに接続しています。選択肢の提示と結果の実行はアプリケーションが担います。
Reflex-1 /意思決定モデル
質問から選択まで。
01 / 入力
決定を定義してください。
アプリケーションは、状態、質問、および処理できる選択肢を提供します。これらの選択肢は、サポートキュー、利用可能なツール、許可されているアクションなど、リクエストのたびに変わる可能性があります。
都道府県+質問
お客様には2回請求されました。
どの問題が一致しますか?コンテキスト + 質問ModernBERTそれぞれの選択肢MiniLM共有スコアリングヘッド選択確率[アプリケーション]権限 → 引数 → アクション例示的なサポートリクエスト。アプリケーションが候補セットを定義します。 02 / エンコード
コンテキストと候補を代表してください。
適合した ModernBERT エンコーダが状態と質問を読み取ります。フローズンMiniLMエンコーダは、指定された各選択肢を表します。複数の質問が 1 つのパック状態を共有できます。
都道府県+質問
お客様には2回請求されました。
どの問題が一致しますか?コンテキスト + 質問ModernBERTそれぞれの選択肢MiniLM共有スコアリングヘッド選択確率[アプリケーション]権限 → 引数 → アクション2 つのエンコーダが 1 つの共有スコアリングヘッドに給電します。これはプレビューアーキテクチャの概略図です。 03 / 採点
1つのパスで与えられたすべての選択肢を採点します。
共有ヘッドは、コンテキストと候補表現を組み合わせて、指定された選択肢の確率分布を返します。新しい意思決定タイプには、やはり精度テストとキャリブレーションテストが必要です。
都道府県+質問
お客様には2回請求されました。
どの問題が一致しますか?コンテキスト + 質問ModernBERTそれぞれの選択肢MiniLM共有スコアリングヘッド選択確率[アプリケーション]権限 → 引数 → アクション指定された候補ごとに 1 つのスコアを、確率分布に正規化します。 04 / 行動
決定はアプリケーションに任せてください。
アプリケーションは、許可するアクションを決定し、任意のツール引数を作成し、選択したアクションを実行します。Reflex-1がスコアを提供し、周囲のシステムが制御ループを所有します。
都道府県+質問
お客様には2回請求されました。
どの問題が一致しますか?コンテキスト + 質問ModernBERTそれぞれの選択肢MiniLM共有スコアリングヘッド選択確率[アプリケーション]権限 → 引数 → アクションアプリケーションの境界は重要です。ツールにスコアを付けても、ツールは実行されません。
公開開発プレビューのアーキテクチャ。サポートリクエストには入力形式が示されています。
録画による実例
上の Dino の録画と以下の例は、デフォルトの公開重みとは異なる10 月 3 日のスナップショットを使用しています。実行条件と結果は動画の説明に記載しています。
CPU 推論
現在のチェックポイントを Intel Xeon Platinum 8558 CPU 上で FP32、同時リクエスト数一件として測定しました。各スレッド設定では、新規プロセス二つで 120 入力に対して合計 480 回呼び出しています。トークン化と推論を計時に含めています。
現行モデルの CPU 測定結果
Intel Xeon Platinum 8558 · FP32 · バッチサイズ 1計算スレッド数:1
- AG News 1209.7 / 1385.0 ms
- SST-5 973.6 / 1160.3 ms
- Emotion 956.9 / 1165.8 ms
- Banking77 1101.7 / 1276.9 ms
- BoolQ 1600.8 / 2710.6 ms
計算スレッド数:4
- AG News 389.5 / 480.4 ms
- SST-5 320.6 / 404.2 ms
- Emotion 318.8 / 391.0 ms
- Banking77 375.2 / 452.1 ms
- BoolQ 486.7 / 782.2 ms
各スレッド設定で、新規プロセスを二つ使用し、120 入力に対して 480 回呼び出しました。トークン化と推論を含み、読み込みとウォームアップは除外。共有ホストの評価ランタイムを使用し、リクエスト間キャッシュは無効です。
プロセスのピークメモリは、読み込み、ウォームアップ、推論を含めて 2.17 GiB でした。PyTorch の演算内スレッドを一つまたは四つ、演算間スレッドを一つとし、BLAS も演算内スレッド数に合わせました。実行時の補助スレッドを含む OS スレッド総数は、それぞれ二つと十一でした。
現在の測定と評価。共有ホストの評価ランタイムで測定し、読み込み、ウォームアップ、リクエスト間キャッシュを除外しています。研究ページには以前の M4 と H200 の測定値をチェックポイントの日付とともに掲載しています。
Reflex-1 を試す
重み、トークナイザー、推論コードは Hugging Face で公開しています。アカウントや API キーは不要です。依存パッケージをインストールすると、次のコードを実行できます。
import torch
from transformers import AutoModel
torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)
decision = model.predict(
state="The customer was charged twice for one card payment.",
question="Choose the matching issue.",
options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)
インストール方法、実行時の制限、学習データの利用条件を含むライセンス情報は、モデルカードをご覧ください。
モデル詳細
Reflex-1
ツールの振り分け、意図分類、行動選択のための 421M パラメータモデル。重みを公開し、CPU または GPU で実行できます。