研究 重み公開
Reflex-1
エージェント向け意思決定モデル
エージェント向けの 421M パラメータの意思決定モデル。CPU または GPU 上で、順伝播一回で選択肢を評価します。
ファインチューニング済みの重みを Hugging Face で公開しています。
概要
エージェントの決定の多くは、どのキューがリクエストを受け取るか、 どのツールがタスクに適しているか、次にどのアクションを実行するかという選択で終わります。Reflex-1は、 1回のフォワードパスでアプリケーションが提供する選択肢をスコアリングします。アプリケーションがその決定に使用できる確率分布を返します 。
本研究は Jev が探る意思決定モデルの方向性を踏まえ、独自のアーキテクチャと教師あり学習手順を採用しています。28 層のコンテキストエンコーダーと六層の候補エンコーダーを共通のスコアリングヘッドに接続し、現在のチェックポイントでは全 420,778,370 パラメーターを更新しています。
最新のファインチューニング済みチェックポイントが標準の公開ダウンロード対象です。モデルカードには現在の評価結果と CPU 測定値を掲載しています。以下の日付付きの研究結果と録画には元のチェックポイント情報を残しています。
意思決定モデル
公開版 · ランタイム 1.0.0- 使用
- アプリケーションが提供するオプション (ラベル、ルート、実行可能なアクション) の中から選択します。
- 入力 → 出力
- ステート、質問、1~255の選択肢 → 1回のフォワードパスでの選択肢分布
- モデル
- 421M パラメーター。28 層のコンテキストエンコーダー、6 層の候補エンコーダー、共通のスコアリングヘッドで構成します。
- ローカルで実行
- CPU または GPU · FP32。現在の CPU リプレイでは、計算スレッドが一つまたは四つの条件で、プロセスのピークメモリは 2.17 GiB でした。
- 評価
- Banking77 の評価用に確保した 495 件で 92.93%、ネイティブ MiniWoB++ では 21/30 エピソードを完了しました。これらのタスク種別は訓練にも含まれています。
- 利用方法
- Apache 2.0 のパブリックウェイト、トークナイザー、推論コード。英語テキスト; ランタイム 1.0.0。
最新のファインチューニング済みチェックポイントが標準のダウンロード対象です。以下の日付付きの研究結果と録画は以前のチェックポイントに対応します。選択肢の提示と実行の制御はアプリケーションが担います。
現行モデルの結果
10 月 5 日のリリースは、固定したコントローラでネイティブ MiniWoB++ のブラウザエピソードを 21/30 件完了しました。Banking77 の 495 例で正解率 92.93%を記録しています。学習に含まれるタスク群の予約済みサブセットであり、ベンチマーク全体のスコアではありません。
| タスク | 正解数 / 評価件数 | 正解率 |
|---|---|---|
| AG News | 465 / 500 | 93.00% |
| SST-5 | 299 / 500 | 59.80% |
| Emotion | 458 / 500 | 91.60% |
| Banking77 | 460 / 495 | 92.93% |
| BoolQ | 171 / 202 | 84.65% |
| MNLI | 436 / 500 | 87.20% |
| RACE | 287 / 500 | 57.40% |
| SciQ | 123 / 128 | 96.09% |
Intel Xeon Platinum 8558 CPU で四つの計算スレッドを使用した Banking77 推論は、中央値 375.2 ms、p95 は 452.1 msでした。読み込み、ウォームアップ、推論を含むプロセスメモリのピークは 2.17 GiBです。
現行モデルの CPU 測定結果
Intel Xeon Platinum 8558 · FP32 · バッチサイズ 1計算スレッド数:1
- AG News 1209.7 / 1385.0 ms
- SST-5 973.6 / 1160.3 ms
- Emotion 956.9 / 1165.8 ms
- Banking77 1101.7 / 1276.9 ms
- BoolQ 1600.8 / 2710.6 ms
計算スレッド数:4
- AG News 389.5 / 480.4 ms
- SST-5 320.6 / 404.2 ms
- Emotion 318.8 / 391.0 ms
- Banking77 375.2 / 452.1 ms
- BoolQ 486.7 / 782.2 ms
各スレッド設定で、新規プロセスを二つ使用し、120 入力に対して 480 回呼び出しました。トークン化と推論を含み、読み込みとウォームアップは除外。共有ホストの評価ランタイムを使用し、リクエスト間キャッシュは無効です。
評価全体はまだ完了していません。BoolQ、RACE、公開 JevBench 診断の結果は前のチェックポイントから低下しました。ネイティブ Dino で 60 秒の目標を達成したのは試行 0/16 件です。現行モデルの GPU レイテンシは未測定です。公開評価にチェックポイント、条件、未検証の項目を記載しています。
仕組み
回答候補は、各リクエストとともに提供されます。このモデルは、トークンの制限内で、 質問ごとに1〜255の選択肢をサポートし、 複数の質問でパック状態を共有できます。サポートアプリケーションは独自のキューを提供でき、 エージェントは利用可能なツールの説明を提供できます。 新しい意思決定タイプには独自の精度テストが必要です。
モデルは指定されたオプションを採点し、アプリケーションはツールの引数を作成し、どのアクションを許可するかを決定します。ステートテキストは 512
個のコンテキストトークナイザートークンに制限されており、リクエストバジェットに応じてさらに短縮できます。
各選択肢は、最大 512 個のオプショントークナイザートークンを受け入れます。state_truncated
コンテキストが短縮された可能性があるかどうかを調べます。
Reflex-1 /意思決定モデル
質問から選択まで。
01 / 入力
決定を定義してください。
アプリケーションは、状態、質問、および処理できる選択肢を提供します。これらの選択肢は、サポートキュー、利用可能なツール、許可されているアクションなど、リクエストのたびに変わる可能性があります。
都道府県+質問
お客様には2回請求されました。
どの問題が一致しますか?コンテキスト + 質問ModernBERTそれぞれの選択肢MiniLM共有スコアリングヘッド選択確率[アプリケーション]権限 → 引数 → アクション例示的なサポートリクエスト。アプリケーションが候補セットを定義します。 02 / エンコード
コンテキストと候補を代表してください。
適合した ModernBERT エンコーダが状態と質問を読み取ります。フローズンMiniLMエンコーダは、指定された各選択肢を表します。複数の質問が 1 つのパック状態を共有できます。
都道府県+質問
お客様には2回請求されました。
どの問題が一致しますか?コンテキスト + 質問ModernBERTそれぞれの選択肢MiniLM共有スコアリングヘッド選択確率[アプリケーション]権限 → 引数 → アクション2 つのエンコーダが 1 つの共有スコアリングヘッドに給電します。これはプレビューアーキテクチャの概略図です。 03 / 採点
1つのパスで与えられたすべての選択肢を採点します。
共有ヘッドは、コンテキストと候補表現を組み合わせて、指定された選択肢の確率分布を返します。新しい意思決定タイプには、やはり精度テストとキャリブレーションテストが必要です。
都道府県+質問
お客様には2回請求されました。
どの問題が一致しますか?コンテキスト + 質問ModernBERTそれぞれの選択肢MiniLM共有スコアリングヘッド選択確率[アプリケーション]権限 → 引数 → アクション指定された候補ごとに 1 つのスコアを、確率分布に正規化します。 04 / 行動
決定はアプリケーションに任せてください。
アプリケーションは、許可するアクションを決定し、任意のツール引数を作成し、選択したアクションを実行します。Reflex-1がスコアを提供し、周囲のシステムが制御ループを所有します。
都道府県+質問
お客様には2回請求されました。
どの問題が一致しますか?コンテキスト + 質問ModernBERTそれぞれの選択肢MiniLM共有スコアリングヘッド選択確率[アプリケーション]権限 → 引数 → アクションアプリケーションの境界は重要です。ツールにスコアを付けても、ツールは実行されません。
公開開発プレビューのアーキテクチャ。サポートリクエストには入力形式が示されています。
実例
以下の例と意思決定品質の比較には 10 月 3 日のスナップショット を使用しています。速度とリソースの測定は別途明記しています。各録画には失敗を含め、実際の終了場面を残しています。
Chromium Dino
この録画は Chromium 本来の chrome://dino ゲームを使用しています。Reflex-1 は現在見える障害物の形状を受け取り、走る・跳ぶ・かがむを選びます。通常のキーボードイベントで実行され、推論中もゲームの時計は進みます。動画は実際のブラウザー画面を通常速度で表示します。
このスナップショットでの 2 回の試行は、42.31 秒と30.41 秒で衝突し、どちらも 60 秒の上限には届きませんでした。長い試行を先に示します。独立したランダムコースのため、対応のあるモデル比較には使えません。2 回目の試行も下に全編を掲載しています。
Dino の 二回目の試行を見る
ViZDoom
ゲームはネイティブ ViZDoom の Defend the Center シナリオ、難易度 5 です。Reflex-1 は見える物体の境界、体力、弾薬量から行動を選びます。構造化状態を使う制御器であり、画素から行動を推論するものではありません。下の録画は事前に指定した例を Reflex-1 単独の画面で示しています。
全 32 予約済みエピソードで、平均18.88 体撃破、生存時間22.47 秒でした。すべて 45 秒の上限前に終了しました。グラフには、評価した外部モデルすべてと全エピソード数を残しています。
ViZDoom · 撃破数と生存の限界
2026 年 10 月 3 日 · 開発スナップショット 70a843878214Defend the Center · 難易度 5
- Reflex-145 s 到達 0/32 · 死亡 32 回 · エラー 0 件 · 平均生存 22.47 s 18.995% 信頼区間 16.6–21.2
- Laya45 s 到達 0/32 · 死亡 32 回 · エラー 0 件 · 平均生存 4.90 s 1.495% 信頼区間 1.2–1.6
- OpenJev · DeBERTa45 s 到達 0/32 · 死亡 32 回 · エラー 0 件 · 平均生存 4.90 s 1.495% 信頼区間 1.2–1.6
- Kev-0.8B45 s 到達 0/32 · 死亡 32 回 · エラー 0 件 · 平均生存 4.90 s 1.495% 信頼区間 1.2–1.6
ここで Reflex-1 は掲載した 10 月 3 日の開発重みを指し、標準ダウンロードや最終版ではありません。 元の ViZDoom エンジン、構造化した可視状態入力、argmax の行動を直接使用し、上限は 45 秒です。宣言した全結果を残しています。平均の区間は対応するシードを 10,000 回再標本化します。予約済みシードでも構造化状態が未見とは限りません。指定した適応器・環境の比較であり、公式スコアや画素入力の方策評価ではありません。
ブラウザーのワークフロー
Laya Browser に同梱された合成 WebGym サイトをローカルで実行しています。実際の Chromium でブラウザー状態を記録し、元のタスク判定器で成功を判定します。Reflex-1 が行動と対象を選び、共通の Qwen3-1.7B 補助モデルが入力文字列と選択リストの値を供給します。結果はこのシステム全体を評価しています。
レストランのタスクは成功し、買い物のタスクは失敗しました。同じ事前指定のタスクシードを使い、実際の結末を残しています。取得したブラウザー状態を実時間の 4× で再生し、終了画面の保持も残しています。合成サイトでの開発結果であり、MiniWoB++、WebArena、実サイトのスコアではありません。
ブラウザーの完了率 · 合成 WebGym
2026 年 10 月 3 日 · 開発スナップショット 70a843878214- Reflex-1判断呼び出し 485 回(エラー 0 件)· 補助モデル呼び出し 102 回(HTTP 0 件 / インターフェース仕様違反 5 件) 13/35
- Laya Browser判断呼び出し 505 回(エラー 0 件)· 補助モデル呼び出し 100 回(HTTP 0 件 / インターフェース仕様違反 7 件) 17/35
- Laya判断呼び出し 56 回(エラー 0 件)· 補助モデル呼び出し 12 回(HTTP 0 件 / インターフェース仕様違反 0 件) 0/35
- OpenJev · DeBERTa判断呼び出し 35 回(エラー 24 件)· 補助モデル呼び出し 0 回(HTTP 0 件 / インターフェース仕様違反 0 件) 0/35
- Kev-0.8B判断呼び出し 196 回(エラー 0 件)· 補助モデル呼び出し 82 回(HTTP 0 件 / インターフェース仕様違反 0 件) 1/35
ここで Reflex-1 は掲載した 10 月 3 日の開発重みを指し、標準ダウンロードや最終版ではありません。 ローカルの合成 WebGym サイトを実 Chromium で記録。全条件で同じ実行器、Qwen3-1.7B 補助モデル、40 ステップ上限を使います。Reflex-1 は BF16 autocast、状態 1,024 / リクエスト 16,384 トークンです。他の実行条件はダウンロードに記載しています。各条件の全 35 試行、リクエスト失敗、補助モデルのエラーを含みます。MiniWoB++、WebArena、実サイト評価とは別です。
この評価で Reflex-1 は 13/35、Laya Browser は 17/35 のタスクを完了しました。失敗やモデルリクエストのエラーも含む全試行を分母に残しています。後に公式 MiniWoB++ 環境で行った予備試験では、このスナップショットは 0/30 でした。合成サイトの結果を同ベンチマークの成功と解釈することはできません。
判断の精度
Typed Decisions は顧客対応、請求書処理、セキュリティ警告、エージェントの実行履歴を扱います。元の状態グループを保ち、共通の選択肢インターフェースで各モデルに同じ 5 判断を求めます。Reflex-1 は 1,508/2,000 件に正解しました(75.4%)。
構造化された意思決定
2026 年 10 月 3 日 · 開発スナップショット 70a843878214カスタマーサポート
- Reflex-1383/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 76.6%95% 信頼区間 72.0–80.8%
- Laya・ネイティブ210/500 正解 · エラー 0 件 · 状態の切り詰め 39 件 42.0%95% 信頼区間 38.2–45.8%
- OpenJev · DeBERTa206/500 正解 · エラー 0 件 · 状態の切り詰め 350 件 41.2%95% 信頼区間 37.8–44.0%
- Kev-0.8B314/500 正解 · エラー 0 件 · 状態の切り詰め 10 件 62.8%95% 信頼区間 58.2–67.4%
請求書処理
- Reflex-1394/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 78.8%95% 信頼区間 75.0–82.4%
- Laya・ネイティブ192/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 38.4%95% 信頼区間 32.6–44.6%
- OpenJev · DeBERTa203/500 正解 · エラー 0 件 · 状態の切り詰め 500 件 40.6%95% 信頼区間 38.2–43.0%
- Kev-0.8B252/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 50.4%95% 信頼区間 45.2–55.8%
セキュリティ警告
- Reflex-1362/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 72.4%95% 信頼区間 68.4–76.2%
- Laya・ネイティブ167/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 33.4%95% 信頼区間 30.0–37.0%
- OpenJev · DeBERTa210/500 正解 · エラー 0 件 · 状態の切り詰め 275 件 42.0%95% 信頼区間 39.2–44.6%
- Kev-0.8B236/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 47.2%95% 信頼区間 42.6–51.8%
エージェントの実行履歴
- Reflex-1369/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 73.8%95% 信頼区間 69.0–78.4%
- Laya・ネイティブ193/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 38.6%95% 信頼区間 33.4–44.0%
- OpenJev · DeBERTa192/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 38.4%95% 信頼区間 34.6–42.2%
- Kev-0.8B179/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 35.8%95% 信頼区間 31.6–40.4%
ここで Reflex-1 は掲載した 10 月 3 日の開発重みを指し、標準ダウンロードや最終版ではありません。 予約済みの元状態 400 件を 2,000 判断に展開し、各ワークフローは 500 判断です。元状態を再標本化し、関連する 5 ヘッドを保って区間を求めます。 トークン上限:Reflex-1: 状態 1,024, リクエスト 4,096; Laya · 標準: リクエスト 512, 指示/選択肢 192; OpenJev · DeBERTa: 状態 256, リクエスト 512; Kev-0.8B: 状態 512, 分岐、含む 状態 2,048. 評価群全体での指示/選択肢の短縮件数(タスク別グラフ間で加算不可):Laya · 標準 0/2,000。上の状態切り詰め件数とは別です。
予約済みの CLINC 評価群では、Reflex-1 は意図分類と対象外のリクエスト 3,680/4,490 件に正解しました(82.0%)。未知のツール選択は 72/87 で、外部モデルの最高値 82/87 を下回りました。強みと残る差をともに示します。
意図の振り分け
2026 年 10 月 3 日 · 開発スナップショット 70a843878214既知と未知のリクエスト
- Reflex-13,680/4,490 正解 · エラー 0 件 · 状態の切り詰め 0 件 · 誤棄却 64 件 · 誤受理 370 件 82.0%95% 信頼区間 80.8–83.1%
- Laya・ネイティブ1,425/4,490 正解 · エラー 0 件 · 状態の切り詰め 0 件 · 誤棄却 0 件 · 誤受理 942 件 31.7%95% 信頼区間 30.3–33.2%
- Laya・エクスパンデッド1,017/4,490 正解 · エラー 0 件 · 状態の切り詰め 0 件 · 誤棄却 0 件 · 誤受理 942 件 22.7%95% 信頼区間 21.4–23.9%
- OpenJev · DeBERTa2,496/4,490 正解 · エラー 0 件 · 状態の切り詰め 0 件 · 誤棄却 5 件 · 誤受理 939 件 55.6%95% 信頼区間 54.1–57.0%
- Kev-0.8B2,298/4,490 正解 · エラー 0 件 · 状態の切り詰め 0 件 · 誤棄却 1 件 · 誤受理 937 件 51.2%95% 信頼区間 49.6–52.6%
ここで Reflex-1 は掲載した 10 月 3 日の開発重みを指し、標準ダウンロードや最終版ではありません。 予約済み 4,490 リクエスト:既知意図 3,548 件、対象外 942 件です。Laya 標準条件と、別に明示した拡張コンテキスト条件をともに表示しています。 トークン上限:Reflex-1: 状態 1,024, リクエスト 4,096; Laya · 標準: リクエスト 512, 指示/選択肢 192; Laya · 拡張: リクエスト 2,048, 指示/選択肢 1,536; OpenJev · DeBERTa: 状態 256, リクエスト 512; Kev-0.8B: 状態 512, 分岐、含む 状態 2,048. 評価群全体での指示/選択肢の短縮件数(タスク別グラフ間で加算不可):Laya · 標準 4,490/4,490、Laya · 拡張 0/4,490。上の状態切り詰め件数とは別です。
未知のツールの選択
2026 年 10 月 3 日 · 開発スナップショット 70a843878214ツールの選択
- Reflex-172/87 正解 · エラー 0 件 · 状態の切り詰め 0 件 82.8%95% 信頼区間 74.7–90.8%
- Laya・ネイティブ80/87 正解 · エラー 0 件 · 状態の切り詰め 14 件 92.0%95% 信頼区間 86.2–97.7%
- Laya・エクスパンデッド80/87 正解 · エラー 0 件 · 状態の切り詰め 0 件 92.0%95% 信頼区間 86.2–97.7%
- OpenJev · DeBERTa82/87 正解 · エラー 0 件 · 状態の切り詰め 30 件 94.3%95% 信頼区間 88.5–98.9%
- Kev-0.8B81/87 正解 · エラー 0 件 · 状態の切り詰め 1 件 93.1%95% 信頼区間 87.4–97.7%
ここで Reflex-1 は掲載した 10 月 3 日の開発重みを指し、標準ダウンロードや最終版ではありません。 訓練前にツール名と正規化状態を分離した 87 の予約済みリクエストです。ツール選択への適応であり、引数生成や実行は対象外です。 トークン上限:Reflex-1: 状態 1,024, リクエスト 4,096; Laya · 標準: リクエスト 512, 指示/選択肢 192; Laya · 拡張: リクエスト 2,048, 指示/選択肢 1,536; OpenJev · DeBERTa: 状態 256, リクエスト 512; Kev-0.8B: 状態 512, 分岐、含む 状態 2,048. 評価群全体での指示/選択肢の短縮件数(タスク別グラフ間で加算不可):Laya · 標準 87/87、Laya · 拡張 65/87。上の状態切り詰め件数とは別です。
これらは明示した評価群での共通選択肢形式への適応であり、公式ランキングへの提出ではありません。外部モデルは配布状態で評価し、Reflex-1 のタスク別訓練は受けていません。元の不確実性区間、トークン予算、切り詰め件数を図に残しています。
速度とリソース
この節の測定値は 10 月 2 日のチェックポイントに対応します。現在のチェックポイントの測定値は、上記リンク先のモデルカードで確認できます。
H200 リクエストレイテンシ
共有の NVIDIA H200 で、120 件の異なるリクエストをモデルごとに 2 回リプレイしました。 それらは5つのゲーム環境とブラウザ環境から来ました。 すべてのモデルが同じ入力を受け取りましたが、一度に 1 つのリクエストが処理されました。
H200 リクエストレイテンシ
120入力·2リピート·1リクエスト (飛行中)- Reflex-1FP32 27.5 / 30.5
- OpenJevFP32 32.0 / 33.8
- Laya (ネイティブ)BF16 27.1 / 142.0
- Laya (FP32 リプレイ)FP32 40.2 / 44.4
ドット:中央値ラインエンド:p95トークン化、スコアリング、ループバック HTTP を含み、ロードとウォームアップは含まれません。
完全な測定テーブルとプロトコル
| モデル | 計算資源 | 中央値 | p95 |
|---|---|---|---|
| reflex-1 | FP32 | 27.5 | 30.5 |
| OpenJev | FP32 | 32.0 | 33.8 |
| Laya (ネイティブ) | BF16 | 27.1 | 142.0 |
| Laya (FP32 リプレイ) | FP32 | 40.2 | 44.4 |
Laya ネイティブはBF16オートキャストを使用します。個別のFP32リプレイも含まれています。OpenJevは公開されているDeBertaチェックポイントであり、Jevがホストしているチェックポイントではありません。これらのリクエストタイミングは、タスクの成功または同時スループットを測定しません。2026-09-29に録音されました。
reflex-1 の中央値は 27.5 ms、p95 は 30.5 ms でした。FP32 の OpenJev、および別途 FP32 で再測定した Laya より高速でした。Laya の標準設定は BF16 autocast を使い、中央値はわずかに低くなりました。共有マシンと限られたサンプル数での測定のため、僅差の結果から導ける結論には限界があります。
タイマーには、トークン化、モデルスコアリング、出力正規化、ループバック HTTP が含まれます。 ロードと 3 回のウォームアップリクエストは含まれません。 回答キャッシュとオプションキャッシュは無効になりました。この実行では、 同時処理のスループットを測定しませんでした。OpenJev は公開されている DeBerta チェックポイントで、ホストされている Jev サービスではありません。
M4 CPU レイテンシ
CPUテストでは、MacBook Air M4、FP32、およびバッチサイズ1を使用しました。各モデルは、PyTorch のイントラオペレーションスレッドを1つとオペレーション間スレッドを1つ使用し、BLASスレッドの制限は1つでした。 各タスクには24の異なるケースがあり、 それぞれ2回繰り返されました。モデルの順序は 8 つの実行ブロックでバランスが取れていました。
M4 CPU リクエストレイテンシ
FP32 · バッチ 1 · PyTorch スレッド 1/1 · BLASリミット 1Banking77
- Reflex-1 345.2 / 692.0
- OpenJev 1,332.6 / 2,857.1
- Laya 912.4 / 2,649.9
- Kev 4,283.4 / 11,073.7
Emotion
- Reflex-1 256.2 / 610.4
- OpenJev 381.8 / 1,029.5
- Laya 240.1 / 427.7
- Kev 1,121.9 / 4,422.3
AG News
- Reflex-1 321.7 / 578.7
- OpenJev 424.5 / 934.0
- Laya 324.1 / 760.5
- Kev 1,356.5 / 4,997.2
SST-5
- Reflex-1 299.1 / 631.0
- OpenJev 360.5 / 894.5
- Laya 250.7 / 548.5
- Kev 902.2 / 4,480.5
BoolQ
- Reflex-1 463.4 / 1,329.1
- OpenJev 451.9 / 1,398.9
- Laya 440.4 / 1,587.9
- Kev 1,775.3 / 6,548.0
点は中央値、線の端は p95 を示します。全タスクで同じ対数目盛を使用しています。メモリ:Reflex-1 の別測定で、プロセスの最大常駐メモリ(RSS)は 1.50 GiB でした。この比較ではモデルごとのメモリを測定していません。
完全な測定テーブルとプロトコル
| タスク | reflex-1 | OpenJev | Laya | Kev |
|---|---|---|---|---|
| Banking77 | 345.2/ 692.0 | 1332.6/ 2857.1 | 912.4/ 2649.9 | 4283.4/ 11073.7 |
| Emotion | 256.2/ 610.4 | 381.8/ 1029.5 | 240.1/ 427.7 | 1121.9/ 4422.3 |
| AG News | 321.7/ 578.7 | 424.5/ 934.0 | 324.1/ 760.5 | 1356.5/ 4997.2 |
| SST-5 | 299.1/ 631.0 | 360.5/ 894.5 | 250.7/ 548.5 | 902.2/ 4480.5 |
| BoolQ | 463.4/ 1329.1 | 451.9/ 1398.9 | 440.4/ 1587.9 | 1775.3/ 6548.0 |
ネイティブランタイム予算。Laya はBanking77のオプションを現地の予算で切り捨てています。予算拡大の結果は別途報告されます。KevはCPUリファレンスカーネルと統合されていないアダプターを使用しています。2026-09-24に録音されました。
Reflex-1 測定メモリ:1.50 GiB ピークプロセスRSS元の120個の入力を個別にReflex-1リソースで再生し、それぞれ2回のスコアを付けます。プロセス全体のピーク RSS には、インポート、モデルの読み込み、ウォームアップ、推論が含まれます。元の4つのモデルのレイテンシ比較では、モデルごとのメモリは記録されませんでした。UTC 2026-10-02 UTCを記録しました。リソース測定とプロトコル。
Banking77 では 77 個の意図から選択します。同じ測定で、reflex-1 の中央値は 345.2 ms、OpenJev は 1,332.6 ms でした。5 つのタスクにおける reflex-1 の中央値は 256.2〜463.4 ms でした。
Layaは、選択の少ないいくつかのタスクでより速かった。 ネイティブのBanking77予算ではオプションが切り捨てられていたため、そのタイミングは限られた候補セットを対象としていました。 Kevは、統合されていないアダプターを備えたCPUリファレンスカーネルを使用していました。 バックグラウンドラップトップのアクティビティがテールレイテンシーの拡大の一因となりました。
このテストはモデルを読み込んだ状態で、リクエストの構築から正規化した出力までを計測しています。CPU と GPU では異なるリクエストを使っているため、この時間から CPU に対する GPU の速度向上率を直接算出することはできません。
学習済みタスクの精度
reflex-1はBanking77 で95.0%、Emotion で92.2%のスコアを記録しました。 両者で比較したチェックポイントで首位に立ち、AG News sとSST-5で最高得点を記録し、 BoolQではOpenJevをわずかに下回りました。
意思決定の正確さ
タスクあたり500例・開発診断Banking77
- Reflex-1 95.0%
- OpenJev 90.6%
- Laya・ネイティブ 44.4%
- Laya・エクスパンデッド 55.4%
- Kev 82.4%
Emotion
- Reflex-1 92.2%
- OpenJev 53.0%
- Laya・ネイティブ 57.6%
- Laya・エクスパンデッド 57.6%
- Kev 54.4%
AG News
- Reflex-1 91.2%
- OpenJev 77.4%
- Laya・ネイティブ 91.2%
- Laya・エクスパンデッド 91.2%
- Kev 87.2%
SST-5
- Reflex-1 59.8%
- OpenJev 59.8%
- Laya・ネイティブ 51.0%
- Laya・エクスパンデッド 51.0%
- Kev 55.2%
BoolQ
- Reflex-1 86.0%
- OpenJev 86.8%
- Laya・ネイティブ 71.2%
- Laya・エクスパンデッド 71.2%
- Kev 82.6%
タスクファミリーはトレーニングに含まれ、これらのサブセットは開発中に検査されました。トレーニング露出はモデルによって異なります。Layaのネイティブ予算では、Banking77のオプションが切り捨てられています。
完全な測定テーブルとプロトコル
| タスク | reflex-1 | Laya、ネイティブ | Laya、拡張 | OpenJev | Kev |
|---|---|---|---|---|---|
| Banking77 | 95.0 | 44.4 | 55.4 | 90.6 | 82.4 |
| Emotion | 92.2 | 57.6 | 57.6 | 53.0 | 54.4 |
| AG News | 91.2 | 91.2 | 91.2 | 77.4 | 87.2 |
| SST-5 | 59.8 | 51.0 | 51.0 | 59.8 | 55.2 |
| BoolQ | 86.0 | 71.2 | 71.2 | 86.8 | 82.6 |
Laya SDK 0.3.20は、ネイティブおよび拡張トークンのバジェットで表示されます。Banking77のネイティブバジェットではオプションセットが切り捨てられ、拡張された予算では77のラベルすべてが残ります。これらは開発診断であり、独立した移転評価ではありません。
これらはタスクあたり500例の診断でした。 タスクファミリーはトレーニングに含まれ、開発中にサブセットを検査しました。 トレーニング予算と過去の経験はモデルによって異なります。その他の例では、 精度はレイテンシとは別に測定されました。
ジェネラルチェックポイントは、 カスタムブラウザコントローラーを使用して80回のトライアルのうち0回を完了しました。その結果、 使い慣れたタスク分類と自律制御との間に大きなギャップがあることが明らかになった。 なじみのない質問に移り、確率キャリブレーションは未解決の評価問題のままです。
トレーニングと保管
アダプターのマージ後、サービングモデルには420,778,370のパラメーターがあります。 ModernBERTは状態と質問をエンコードし、フリーズしたMiniLM エンコーダーは選択肢を表します。共有ヘッドはそれらの表現を組み合わせます。
| 資源 | 記録された構成 |
|---|---|
| サービングパラメーター | 420,778,370 |
| 適応訓練を受けたパラメーター | 9,036,290 |
| アダプテーションハードウェア | 1 × エヌビディア H200 |
| メインラン | 6,000 件のアップデート·75 分 7 秒 |
| ディスク上に抽出された FP32 モデル | ≈ 1.69 GB |
| 測定された CPU プロセスメモリ | 1.50 GiB ピーク RSS · 240 リクエストによる個別のリプレイ |
| CPU 計算スレッド | PyTorch イントラオペレーション/インターオペレーション 1/1 · BLAS リミット 1 |
主な適応実行では、8つのタスクファミリーの290,657件のレコードを使用して 、6,000ステップにわたって9,036,290のパラメーターを更新しました。開発画面とチェックポイントセーブを含めて、 1台のH200で75分7秒かかりました。 基本モデルの事前トレーニング、データ準備、予測フィッティング、 および以前の実験には追加コストが発生します。
展開した FP32 モデルはディスク上で約 1.69 GB を占めます。別途行った CPU リソース測定では、フレームワークの割り当て、トークナイザー、読み込み、ウォームアップ、推論を含むプロセスの最大常駐メモリ(RSS)が 1.50 GiB でした。GPU メモリ使用量は未測定です。
モデルアクセス
Hugging Face の公開リリースには、1.68 GBのFP32ウェイト、両方のトークナイザー、およびApache 2.0での自己完結型のTransformers 実装が含まれています。 アカウント、API キー、 GitHub へのアクセスは必要ありません。Python 3.12 を使う:
python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0"
import torch
from transformers import AutoModel
torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)
decision = model.predict(
state="The customer was charged twice for one card payment.",
question="Choose the matching issue.",
options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)
モデルを一度読み込んで再利用します。モデルカードには、バッチ推論、 複数の質問、オフラインロード、リリースハッシュが記載されています。 開発リポジトリは非公開のままです。 公開パッケージには推論に必要なコードが含まれています。
元の訓練には RACE と SciQ を使用しており、それぞれの条件に非商用制限が含まれます。モデルカードに利用方法と固定リビジョンを記載しています。出典の監査は、その条件が訓練済み重みにどう適用されるかを確定するものではありません。
記録と再現方法
録画を再現するには、十月 3 日の固定 Hub リビジョンを使用してください。上の図には既存能力の低下も含めた測定結果を残しています。各録画は環境、入力形式、再生速度を明示しています。
現在のリリースの評価はモデルカードから参照できます。これらの録画と研究では元の結果を保持しています。
研究中も
Samsara-VLA
言語で指示する操作向けの、2つのコンパクトなロボットポリシー。つかむ、置く、開ける、複数手順のタスクを完了する様子をご覧ください。
VIO-lens-2
研究中。