[研究](https://www.goodailabs.com/ja/research/) 重み公開 # Reflex-1 エージェント向け意思決定モデル エージェント向けの 421M パラメータの意思決定モデル。CPU または GPU 上で、順伝播一回で選択肢を評価します。 ファインチューニング済みの重みを Hugging Face で公開しています。 [Hugging Face モデルとウェイト ↗](https://huggingface.co/gai-labs/reflex-1) [モデルを見る ↓](https://www.goodailabs.com/#project-details) [アナウンスを読む ↗](https://www.goodailabs.com/ja/blog/reflex-1-fast-decisions/) ## 概要 エージェントの決定の多くは、どのキューがリクエストを受け取るか、 どのツールがタスクに適しているか、次にどのアクションを実行するかという選択で終わります。Reflex-1は、 1回のフォワードパスでアプリケーションが提供する選択肢をスコアリングします。アプリケーションがその決定に使用できる確率分布を返します 。 本研究は [Jev](https://docs.typesafe.ai/introduction) が探る意思決定モデルの方向性を踏まえ、独自のアーキテクチャと教師あり学習手順を採用しています。28 層のコンテキストエンコーダーと六層の候補エンコーダーを共通のスコアリングヘッドに接続し、現在のチェックポイントでは全 420,778,370 パラメーターを更新しています。 最新のファインチューニング済みチェックポイントが標準の公開ダウンロード対象です。モデルカードには現在の評価結果と CPU 測定値を掲載しています。以下の日付付きの研究結果と録画には元のチェックポイント情報を残しています。 意思決定モデル 公開版 · ランタイム 1.0.0 使用 アプリケーションが提供するオプション (ラベル、ルート、実行可能なアクション) の中から選択します。 入力 → 出力 ステート、質問、1~255の選択肢 → 1回のフォワードパスでの選択肢分布 モデル 421M パラメーター。28 層のコンテキストエンコーダー、6 層の候補エンコーダー、共通のスコアリングヘッドで構成します。 ローカルで実行 CPU または GPU · FP32。現在の CPU リプレイでは、計算スレッドが一つまたは四つの条件で、プロセスのピークメモリは 2.17 GiB でした。 評価 Banking77 の評価用に確保した 495 件で 92.93%、ネイティブ MiniWoB++ では 21/30 エピソードを完了しました。これらのタスク種別は訓練にも含まれています。 利用方法 Apache 2.0 のパブリックウェイト、トークナイザー、推論コード。英語テキスト; ランタイム 1.0.0。 最新のファインチューニング済みチェックポイントが標準のダウンロード対象です。以下の日付付きの研究結果と録画は以前のチェックポイントに対応します。選択肢の提示と実行の制御はアプリケーションが担います。 [重みと推論 ↗](https://huggingface.co/gai-labs/reflex-1)[リリースの結果 ↗](https://www.goodailabs.com/ja/research/reflex-1/#current-results) ## 現行モデルの結果 10 月 5 日のリリースは、固定したコントローラでネイティブ MiniWoB++ のブラウザエピソードを 21/30 件完了しました。Banking77 の 495 例で正解率 92.93%を記録しています。学習に含まれるタスク群の予約済みサブセットであり、ベンチマーク全体のスコアではありません。 10 月 5 日のチェックポイント · 分類評価用の予約済みサブセット タスク | 正解数 / 評価件数 | 正解率 | AG News | 465 / 500 | 93.00% | SST-5 | 299 / 500 | 59.80% | Emotion | 458 / 500 | 91.60% | Banking77 | 460 / 495 | 92.93% | BoolQ | 171 / 202 | 84.65% | MNLI | 436 / 500 | 87.20% | RACE | 287 / 500 | 57.40% | SciQ | 123 / 128 | 96.09% | Intel Xeon Platinum 8558 CPU で四つの計算スレッドを使用した Banking77 推論は、中央値 375.2 ms、p95 は 452.1 msでした。読み込み、ウォームアップ、推論を含むプロセスメモリのピークは 2.17 GiBです。 現行モデルの CPU 測定結果 Intel Xeon Platinum 8558 · FP32 · バッチサイズ 1 計算スレッド数:1 レイテンシ · 低いほど高速中央値/p95 - AG News 1209.7 / 1385.0 ms - SST-5 973.6 / 1160.3 ms - Emotion 956.9 / 1165.8 ms - Banking77 1101.7 / 1276.9 ms - BoolQ 1600.8 / 2710.6 ms 01,5003,000 ms 計算スレッド数:4 レイテンシ · 低いほど高速中央値/p95 - AG News 389.5 / 480.4 ms - SST-5 320.6 / 404.2 ms - Emotion 318.8 / 391.0 ms - Banking77 375.2 / 452.1 ms - BoolQ 486.7 / 782.2 ms 01,5003,000 ms 各スレッド設定で、新規プロセスを二つ使用し、120 入力に対して 480 回呼び出しました。トークン化と推論を含み、読み込みとウォームアップは除外。共有ホストの評価ランタイムを使用し、リクエスト間キャッシュは無効です。 評価全体はまだ完了していません。BoolQ、RACE、公開 JevBench 診断の結果は前のチェックポイントから低下しました。ネイティブ Dino で 60 秒の目標を達成したのは試行 0/16 件です。現行モデルの GPU レイテンシは未測定です。[公開評価](https://huggingface.co/gai-labs/reflex-1/blob/84c2cd49d31f73544e1e17539092056e741e7f03/evaluation.json)にチェックポイント、条件、未検証の項目を記載しています。 ## 仕組み 回答候補は、各リクエストとともに提供されます。このモデルは、トークンの制限内で、 質問ごとに1〜255の選択肢をサポートし、 複数の質問でパック状態を共有できます。サポートアプリケーションは独自のキューを提供でき、 エージェントは利用可能なツールの説明を提供できます。 新しい意思決定タイプには独自の精度テストが必要です。 モデルは指定されたオプションを採点し、アプリケーションはツールの引数を作成し、どのアクションを許可するかを決定します。ステートテキストは 512 個のコンテキストトークナイザートークンに制限されており、リクエストバジェットに応じてさらに短縮できます。 各選択肢は、最大 512 個のオプショントークナイザートークンを受け入れます。state_truncated コンテキストが短縮された可能性があるかどうかを調べます。 Reflex-1 /意思決定モデル ### 質問から選択まで。 - 01 / 入力 #### 決定を定義してください。 アプリケーションは、状態、質問、および処理できる選択肢を提供します。これらの選択肢は、サポートキュー、利用可能なツール、許可されているアクションなど、リクエストのたびに変わる可能性があります。 都道府県+質問 お客様には2回請求されました。 どの問題が一致しますか? 重複請求カード紛失不明な手数料現金引き出し ↓ コンテキスト + 質問ModernBERT それぞれの選択肢MiniLM ↓ 共有スコアリングヘッド選択確率 ↓ [アプリケーション]権限 → 引数 → アクション 例示的なサポートリクエスト。アプリケーションが候補セットを定義します。 - 02 / エンコード #### コンテキストと候補を代表してください。 適合した ModernBERT エンコーダが状態と質問を読み取ります。フローズンMiniLMエンコーダは、指定された各選択肢を表します。複数の質問が 1 つのパック状態を共有できます。 都道府県+質問 お客様には2回請求されました。 どの問題が一致しますか? 重複請求カード紛失不明な手数料現金引き出し ↓ コンテキスト + 質問ModernBERT それぞれの選択肢MiniLM ↓ 共有スコアリングヘッド選択確率 ↓ [アプリケーション]権限 → 引数 → アクション 2 つのエンコーダが 1 つの共有スコアリングヘッドに給電します。これはプレビューアーキテクチャの概略図です。 - 03 / 採点 #### 1つのパスで与えられたすべての選択肢を採点します。 共有ヘッドは、コンテキストと候補表現を組み合わせて、指定された選択肢の確率分布を返します。新しい意思決定タイプには、やはり精度テストとキャリブレーションテストが必要です。 都道府県+質問 お客様には2回請求されました。 どの問題が一致しますか? 重複請求カード紛失不明な手数料現金引き出し ↓ コンテキスト + 質問ModernBERT それぞれの選択肢MiniLM ↓ 共有スコアリングヘッド選択確率 ↓ [アプリケーション]権限 → 引数 → アクション 指定された候補ごとに 1 つのスコアを、確率分布に正規化します。 - 04 / 行動 #### 決定はアプリケーションに任せてください。 アプリケーションは、許可するアクションを決定し、任意のツール引数を作成し、選択したアクションを実行します。Reflex-1がスコアを提供し、周囲のシステムが制御ループを所有します。 都道府県+質問 お客様には2回請求されました。 どの問題が一致しますか? 重複請求カード紛失不明な手数料現金引き出し ↓ コンテキスト + 質問ModernBERT それぞれの選択肢MiniLM ↓ 共有スコアリングヘッド選択確率 ↓ [アプリケーション]権限 → 引数 → アクション アプリケーションの境界は重要です。ツールにスコアを付けても、ツールは実行されません。 公開開発プレビューのアーキテクチャ。サポートリクエストには入力形式が示されています。 ## 実例 以下の例と意思決定品質の比較には 10 月 3 日のスナップショット を使用しています。速度とリソースの測定は別途明記しています。各録画には失敗を含め、実際の終了場面を残しています。 ### Chromium Dino この録画は Chromium 本来の chrome://dino ゲームを使用しています。Reflex-1 は現在見える障害物の形状を受け取り、走る・跳ぶ・かがむを選びます。通常のキーボードイベントで実行され、推論中もゲームの時計は進みます。動画は実際のブラウザー画面を通常速度で表示します。 Reflex-1 · オリジナル Chromium43.6 秒 · サイレントビデオ [見る:Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-002-clean.mp4). Reflex-1 · Chromium Dino. ネイティブ Chromium Dino で、可視ジオメトリの構造化入力を使う Reflex-1。2026 年 10 月 3 日の開発スナップショットです。独立コースの全編録画は 42.309 秒で衝突して終了し(スコア 535)、60 秒には届きません。推論中もブラウザーは動作します。 通常速度のブラウザー録画。推論中もゲームの時計は進みます。 このスナップショットでの 2 回の試行は、42.31 秒と30.41 秒で衝突し、どちらも 60 秒の上限には届きませんでした。長い試行を先に示します。独立したランダムコースのため、対応のあるモデル比較には使えません。2 回目の試行も下に全編を掲載しています。 Dino の 二回目の試行を見る Reflex-1 · オリジナル Chromium31.8 秒 · サイレントビデオ [見る:Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-003-clean.mp4). Reflex-1 · Chromium Dino. ネイティブ Chromium Dino で、可視ジオメトリの構造化入力を使う Reflex-1。2026 年 10 月 3 日の開発スナップショットです。独立コースの全編録画は 30.410 秒で衝突して終了し(スコア 351)、60 秒には届きません。推論中もブラウザーは動作します。 通常速度のブラウザー録画。推論中もゲームの時計は進みます。 ### ViZDoom ゲームはネイティブ ViZDoom の Defend the Center シナリオ、難易度 5 です。Reflex-1 は見える物体の境界、体力、弾薬量から行動を選びます。構造化状態を使う制御器であり、画素から行動を推論するものではありません。下の録画は事前に指定した例を Reflex-1 単独の画面で示しています。 Reflex-1 · ネイティブ ViZDoom36.5 秒 · サイレントビデオ [見る:Reflex-1 · ViZDoom (MP4)](https://www.goodailabs.com/media/reflex-1/preview/vizdoom-510001-clean.mp4). Reflex-1 · ViZDoom. ネイティブ ViZDoom 1.3.1、Defend the Center、難易度 5 で動く Reflex-1。2026 年 10 月 3 日の開発スナップショットで、事前指定の録画シードは 510001 です。上限 45 秒のうちシミュレーション時間 34.514 秒で死亡し、30 体撃破して終了します。入力は画素ではなく可視エンジンラベルと体力・弾薬です。再生はシミュレーション時間に従い、推論遅延を含みません。 シミュレーション時間に沿って再生し、推論遅延は含めません。元の終了画面の保持は残しています。 全 32 予約済みエピソードで、平均18.88 体撃破、生存時間22.47 秒でした。すべて 45 秒の上限前に終了しました。グラフには、評価した外部モデルすべてと全エピソード数を残しています。 ViZDoom · 撃破数と生存の限界 2026 年 10 月 3 日 · 開発スナップショット 70a843878214 Defend the Center · 難易度 5 撃破数 · 高いほど良い平均 · 95% 区間 - Reflex-145 s 到達 0/32 · 死亡 32 回 · エラー 0 件 · 平均生存 22.47 s 18.995% 信頼区間 16.6–21.2 - Laya45 s 到達 0/32 · 死亡 32 回 · エラー 0 件 · 平均生存 4.90 s 1.495% 信頼区間 1.2–1.6 - OpenJev · DeBERTa45 s 到達 0/32 · 死亡 32 回 · エラー 0 件 · 平均生存 4.90 s 1.495% 信頼区間 1.2–1.6 - Kev-0.8B45 s 到達 0/32 · 死亡 32 回 · エラー 0 件 · 平均生存 4.90 s 1.495% 信頼区間 1.2–1.6 010203040 ここで Reflex-1 は掲載した 10 月 3 日の開発重みを指し、標準ダウンロードや最終版ではありません。 元の ViZDoom エンジン、構造化した可視状態入力、argmax の行動を直接使用し、上限は 45 秒です。宣言した全結果を残しています。平均の区間は対応するシードを 10,000 回再標本化します。予約済みシードでも構造化状態が未見とは限りません。指定した適応器・環境の比較であり、公式スコアや画素入力の方策評価ではありません。 Reflex-1 は平均 18.88 体撃破、生存 22.47 秒で、制限時間までの完了は 0/32 です。Laya、OpenJev、Kev はいずれも平均 1.375 体、完了 0/32 でした。参照モデルは配布状態で使っており、訓練履歴は異なります。 ### ブラウザーのワークフロー Laya Browser に同梱された合成 WebGym サイトをローカルで実行しています。実際の Chromium でブラウザー状態を記録し、元のタスク判定器で成功を判定します。Reflex-1 が行動と対象を選び、共通の Qwen3-1.7B 補助モデルが入力文字列と選択リストの値を供給します。結果はこのシステム全体を評価しています。 Reflex-1 · 合成 WebGym30.1 秒 · 4× · サイレントビデオ [見る:レストラン予約 · タスク完了 (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-restaurant-960000-clean.mp4). レストラン予約 · タスク完了. 10 月 3 日の開発スナップショット。15 行動。Chromium で記録した状態を実時間の 4× で再生し、結末と終了画面の保持を残しています。 ローカルの合成タスク。共通の Qwen3-1.7B テキスト補助モデルを使用。Hub の標準重みとは異なるスナップショットです。 Reflex-1 · 合成 WebGym8.1 秒 · 4× · サイレントビデオ [見る:買い物タスク · 目標未達成 (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-shop-960000-clean.mp4). 買い物タスク · 目標未達成. 10 月 3 日の開発スナップショット。4 行動。Chromium で記録した状態を実時間の 4× で再生し、結末と終了画面の保持を残しています。 ローカルの合成タスク。共通の Qwen3-1.7B テキスト補助モデルを使用。Hub の標準重みとは異なるスナップショットです。 レストランのタスクは成功し、買い物のタスクは失敗しました。同じ事前指定のタスクシードを使い、実際の結末を残しています。取得したブラウザー状態を実時間の 4× で再生し、終了画面の保持も残しています。合成サイトでの開発結果であり、MiniWoB++、WebArena、実サイトのスコアではありません。 ブラウザーの完了率 · 合成 WebGym 2026 年 10 月 3 日 · 開発スナップショット 70a843878214 完了エピソード(%)· 高いほど良い記録値 - Reflex-1判断呼び出し 485 回(エラー 0 件)· 補助モデル呼び出し 102 回(HTTP 0 件 / インターフェース仕様違反 5 件) 13/35 - Laya Browser判断呼び出し 505 回(エラー 0 件)· 補助モデル呼び出し 100 回(HTTP 0 件 / インターフェース仕様違反 7 件) 17/35 - Laya判断呼び出し 56 回(エラー 0 件)· 補助モデル呼び出し 12 回(HTTP 0 件 / インターフェース仕様違反 0 件) 0/35 - OpenJev · DeBERTa判断呼び出し 35 回(エラー 24 件)· 補助モデル呼び出し 0 回(HTTP 0 件 / インターフェース仕様違反 0 件) 0/35 - Kev-0.8B判断呼び出し 196 回(エラー 0 件)· 補助モデル呼び出し 82 回(HTTP 0 件 / インターフェース仕様違反 0 件) 1/35 0255075100 ここで Reflex-1 は掲載した 10 月 3 日の開発重みを指し、標準ダウンロードや最終版ではありません。 ローカルの合成 WebGym サイトを実 Chromium で記録。全条件で同じ実行器、Qwen3-1.7B 補助モデル、40 ステップ上限を使います。Reflex-1 は BF16 autocast、状態 1,024 / リクエスト 16,384 トークンです。他の実行条件はダウンロードに記載しています。各条件の全 35 試行、リクエスト失敗、補助モデルのエラーを含みます。MiniWoB++、WebArena、実サイト評価とは別です。 元サイトの最終状態判定では Reflex-1 が 13/35、Laya Browser が 17/35 を完了しました。専門モデルが依然先行しています。他の 3 外部条件も表示しています。 この評価で Reflex-1 は 13/35、Laya Browser は 17/35 のタスクを完了しました。失敗やモデルリクエストのエラーも含む全試行を分母に残しています。後に公式 MiniWoB++ 環境で行った予備試験では、このスナップショットは 0/30 でした。合成サイトの結果を同ベンチマークの成功と解釈することはできません。 ## 判断の精度 Typed Decisions は顧客対応、請求書処理、セキュリティ警告、エージェントの実行履歴を扱います。元の状態グループを保ち、共通の選択肢インターフェースで各モデルに同じ 5 判断を求めます。Reflex-1 は 1,508/2,000 件に正解しました(75.4%)。 構造化された意思決定 2026 年 10 月 3 日 · 開発スナップショット 70a843878214 カスタマーサポート 精度 (%)・高いほど良い正解率 · 95% 区間 - Reflex-1383/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 76.6%95% 信頼区間 72.0–80.8% - Laya・ネイティブ210/500 正解 · エラー 0 件 · 状態の切り詰め 39 件 42.0%95% 信頼区間 38.2–45.8% - OpenJev · DeBERTa206/500 正解 · エラー 0 件 · 状態の切り詰め 350 件 41.2%95% 信頼区間 37.8–44.0% - Kev-0.8B314/500 正解 · エラー 0 件 · 状態の切り詰め 10 件 62.8%95% 信頼区間 58.2–67.4% 0255075100 請求書処理 精度 (%)・高いほど良い正解率 · 95% 区間 - Reflex-1394/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 78.8%95% 信頼区間 75.0–82.4% - Laya・ネイティブ192/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 38.4%95% 信頼区間 32.6–44.6% - OpenJev · DeBERTa203/500 正解 · エラー 0 件 · 状態の切り詰め 500 件 40.6%95% 信頼区間 38.2–43.0% - Kev-0.8B252/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 50.4%95% 信頼区間 45.2–55.8% 0255075100 セキュリティ警告 精度 (%)・高いほど良い正解率 · 95% 区間 - Reflex-1362/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 72.4%95% 信頼区間 68.4–76.2% - Laya・ネイティブ167/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 33.4%95% 信頼区間 30.0–37.0% - OpenJev · DeBERTa210/500 正解 · エラー 0 件 · 状態の切り詰め 275 件 42.0%95% 信頼区間 39.2–44.6% - Kev-0.8B236/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 47.2%95% 信頼区間 42.6–51.8% 0255075100 エージェントの実行履歴 精度 (%)・高いほど良い正解率 · 95% 区間 - Reflex-1369/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 73.8%95% 信頼区間 69.0–78.4% - Laya・ネイティブ193/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 38.6%95% 信頼区間 33.4–44.0% - OpenJev · DeBERTa192/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 38.4%95% 信頼区間 34.6–42.2% - Kev-0.8B179/500 正解 · エラー 0 件 · 状態の切り詰め 0 件 35.8%95% 信頼区間 31.6–40.4% 0255075100 ここで Reflex-1 は掲載した 10 月 3 日の開発重みを指し、標準ダウンロードや最終版ではありません。 予約済みの元状態 400 件を 2,000 判断に展開し、各ワークフローは 500 判断です。元状態を再標本化し、関連する 5 ヘッドを保って区間を求めます。 トークン上限:Reflex-1: 状態 1,024, リクエスト 4,096; Laya · 標準: リクエスト 512, 指示/選択肢 192; OpenJev · DeBERTa: 状態 256, リクエスト 512; Kev-0.8B: 状態 512, 分岐、含む 状態 2,048. 評価群全体での指示/選択肢の短縮件数(タスク別グラフ間で加算不可):Laya · 標準 0/2,000。上の状態切り詰め件数とは別です。 共通の選択肢インターフェースで、教師が最も多く選んだ選択肢との一致率を測ります。データセットを適応した結果であり、公式の複数ヘッドのランキングスコアではありません。 予約済みの CLINC 評価群では、Reflex-1 は意図分類と対象外のリクエスト 3,680/4,490 件に正解しました(82.0%)。未知のツール選択は 72/87 で、外部モデルの最高値 82/87 を下回りました。強みと残る差をともに示します。 意図の振り分け 2026 年 10 月 3 日 · 開発スナップショット 70a843878214 既知と未知のリクエスト 精度 (%)・高いほど良い正解率 · 95% 区間 - Reflex-13,680/4,490 正解 · エラー 0 件 · 状態の切り詰め 0 件 · 誤棄却 64 件 · 誤受理 370 件 82.0%95% 信頼区間 80.8–83.1% - Laya・ネイティブ1,425/4,490 正解 · エラー 0 件 · 状態の切り詰め 0 件 · 誤棄却 0 件 · 誤受理 942 件 31.7%95% 信頼区間 30.3–33.2% - Laya・エクスパンデッド1,017/4,490 正解 · エラー 0 件 · 状態の切り詰め 0 件 · 誤棄却 0 件 · 誤受理 942 件 22.7%95% 信頼区間 21.4–23.9% - OpenJev · DeBERTa2,496/4,490 正解 · エラー 0 件 · 状態の切り詰め 0 件 · 誤棄却 5 件 · 誤受理 939 件 55.6%95% 信頼区間 54.1–57.0% - Kev-0.8B2,298/4,490 正解 · エラー 0 件 · 状態の切り詰め 0 件 · 誤棄却 1 件 · 誤受理 937 件 51.2%95% 信頼区間 49.6–52.6% 0255075100 ここで Reflex-1 は掲載した 10 月 3 日の開発重みを指し、標準ダウンロードや最終版ではありません。 予約済み 4,490 リクエスト:既知意図 3,548 件、対象外 942 件です。Laya 標準条件と、別に明示した拡張コンテキスト条件をともに表示しています。 トークン上限:Reflex-1: 状態 1,024, リクエスト 4,096; Laya · 標準: リクエスト 512, 指示/選択肢 192; Laya · 拡張: リクエスト 2,048, 指示/選択肢 1,536; OpenJev · DeBERTa: 状態 256, リクエスト 512; Kev-0.8B: 状態 512, 分岐、含む 状態 2,048. 評価群全体での指示/選択肢の短縮件数(タスク別グラフ間で加算不可):Laya · 標準 4,490/4,490、Laya · 拡張 0/4,490。上の状態切り詰め件数とは別です。 Reflex-1 は既知意図の 3,108/3,548 件を正しく振り分け、対象外の 572/942 件を棄却しました。既知の 64 件を誤棄却し、対象外の 370 件を誤受理しました。外部モデルの全条件を残しています。 未知のツールの選択 2026 年 10 月 3 日 · 開発スナップショット 70a843878214 ツールの選択 精度 (%)・高いほど良い正解率 · 95% 区間 - Reflex-172/87 正解 · エラー 0 件 · 状態の切り詰め 0 件 82.8%95% 信頼区間 74.7–90.8% - Laya・ネイティブ80/87 正解 · エラー 0 件 · 状態の切り詰め 14 件 92.0%95% 信頼区間 86.2–97.7% - Laya・エクスパンデッド80/87 正解 · エラー 0 件 · 状態の切り詰め 0 件 92.0%95% 信頼区間 86.2–97.7% - OpenJev · DeBERTa82/87 正解 · エラー 0 件 · 状態の切り詰め 30 件 94.3%95% 信頼区間 88.5–98.9% - Kev-0.8B81/87 正解 · エラー 0 件 · 状態の切り詰め 1 件 93.1%95% 信頼区間 87.4–97.7% 0255075100 ここで Reflex-1 は掲載した 10 月 3 日の開発重みを指し、標準ダウンロードや最終版ではありません。 訓練前にツール名と正規化状態を分離した 87 の予約済みリクエストです。ツール選択への適応であり、引数生成や実行は対象外です。 トークン上限:Reflex-1: 状態 1,024, リクエスト 4,096; Laya · 標準: リクエスト 512, 指示/選択肢 192; Laya · 拡張: リクエスト 2,048, 指示/選択肢 1,536; OpenJev · DeBERTa: 状態 256, リクエスト 512; Kev-0.8B: 状態 512, 分岐、含む 状態 2,048. 評価群全体での指示/選択肢の短縮件数(タスク別グラフ間で加算不可):Laya · 標準 87/87、Laya · 拡張 65/87。上の状態切り詰め件数とは別です。 Reflex-1 はツール選択で 72/87 に正解しました。Laya は各明示条件で 80/87、OpenJev は 82/87、Kev は 81/87 でした。提示されたツールの選択を評価しており、引数生成や実行は含みません。 これらは明示した評価群での共通選択肢形式への適応であり、公式ランキングへの提出ではありません。外部モデルは配布状態で評価し、Reflex-1 のタスク別訓練は受けていません。元の不確実性区間、トークン予算、切り詰め件数を図に残しています。 ## 速度とリソース この節の測定値は 10 月 2 日のチェックポイントに対応します。現在のチェックポイントの測定値は、上記リンク先のモデルカードで確認できます。 ### H200 リクエストレイテンシ 共有の NVIDIA H200 で、120 件の異なるリクエストをモデルごとに 2 回リプレイしました。 それらは5つのゲーム環境とブラウザ環境から来ました。 すべてのモデルが同じ入力を受け取りましたが、一度に 1 つのリクエストが処理されました。 H200 リクエストレイテンシ 120入力·2リピート·1リクエスト (飛行中) ミリ秒·小さいほど速い中央値/p95 - Reflex-1FP32 27.5 / 30.5 - OpenJevFP32 32.0 / 33.8 - Laya (ネイティブ)BF16 27.1 / 142.0 - Laya (FP32 リプレイ)FP32 40.2 / 44.4 04080120160 ドット:中央値ラインエンド:p95トークン化、スコアリング、ループバック HTTP を含み、ロードとウォームアップは含まれません。 120 個の同一の入力。それぞれ 2 回再生され、1 回のリクエストが処理されます。タイミングには、フォーマット、トークン化、推論、およびループバックHTTPが含まれます。スパンの中央中央値 p95です。精度はラベルどおりに異なります。FP32 LLaya のリプレイでは2つの決定が変わりました。 完全な測定テーブルとプロトコル H200 · 同じリクエスト·ミリ秒単位のレイテンシ·低いほど良い モデル | 計算資源 | 中央値 | p95 | reflex-1 | FP32 | 27.5 | 30.5 | OpenJev | FP32 | 32.0 | 33.8 | Laya (ネイティブ) | BF16 | 27.1 | 142.0 | Laya (FP32 リプレイ) | FP32 | 40.2 | 44.4 | Laya ネイティブはBF16オートキャストを使用します。個別のFP32リプレイも含まれています。OpenJevは公開されているDeBertaチェックポイントであり、Jevがホストしているチェックポイントではありません。これらのリクエストタイミングは、タスクの成功または同時スループットを測定しません。2026-09-29に録音されました。 reflex-1 の中央値は 27.5 ms、p95 は 30.5 ms でした。FP32 の OpenJev、および別途 FP32 で再測定した Laya より高速でした。Laya の標準設定は BF16 autocast を使い、中央値はわずかに低くなりました。共有マシンと限られたサンプル数での測定のため、僅差の結果から導ける結論には限界があります。 タイマーには、トークン化、モデルスコアリング、出力正規化、ループバック HTTP が含まれます。 ロードと 3 回のウォームアップリクエストは含まれません。 回答キャッシュとオプションキャッシュは無効になりました。この実行では、 同時処理のスループットを測定しませんでした。OpenJev は公開されている DeBerta チェックポイントで、ホストされている Jev サービスではありません。 ### M4 CPU レイテンシ CPUテストでは、MacBook Air M4、FP32、およびバッチサイズ1を使用しました。各モデルは、PyTorch のイントラオペレーションスレッドを1つとオペレーション間スレッドを1つ使用し、BLASスレッドの制限は1つでした。 各タスクには24の異なるケースがあり、 それぞれ2回繰り返されました。モデルの順序は 8 つの実行ブロックでバランスが取れていました。 M4 CPU リクエストレイテンシ FP32 · バッチ 1 · PyTorch スレッド 1/1 · BLASリミット 1 Banking77 ミリ秒·対数スケール·低いほど速い中央値/p95 - Reflex-1 345.2 / 692.0 - OpenJev 1,332.6 / 2,857.1 - Laya 912.4 / 2,649.9 - Kev 4,283.4 / 11,073.7 1001k10k20k Emotion ミリ秒·対数スケール·低いほど速い中央値/p95 - Reflex-1 256.2 / 610.4 - OpenJev 381.8 / 1,029.5 - Laya 240.1 / 427.7 - Kev 1,121.9 / 4,422.3 1001k10k20k AG News ミリ秒·対数スケール·低いほど速い中央値/p95 - Reflex-1 321.7 / 578.7 - OpenJev 424.5 / 934.0 - Laya 324.1 / 760.5 - Kev 1,356.5 / 4,997.2 1001k10k20k SST-5 ミリ秒·対数スケール·低いほど速い中央値/p95 - Reflex-1 299.1 / 631.0 - OpenJev 360.5 / 894.5 - Laya 250.7 / 548.5 - Kev 902.2 / 4,480.5 1001k10k20k BoolQ ミリ秒·対数スケール·低いほど速い中央値/p95 - Reflex-1 463.4 / 1,329.1 - OpenJev 451.9 / 1,398.9 - Laya 440.4 / 1,587.9 - Kev 1,775.3 / 6,548.0 1001k10k20k 点は中央値、線の端は p95 を示します。全タスクで同じ対数目盛を使用しています。メモリ:Reflex-1 の別測定で、プロセスの最大常駐メモリ(RSS)は 1.50 GiB でした。この比較ではモデルごとのメモリを測定していません。 FP32、バッチサイズ 1。PyTorch の演算内・演算間スレッド数は 1/1、BLAS の上限は 1 スレッドです。元のレイテンシ測定は各タスク 24 入力をそれぞれ 2 回実行しました。別途 Reflex-1 で 240 リクエストを再実行し、読み込み・ウォームアップ・推論を含む最大常駐メモリ(RSS)1.50 GiB を測定しました。元の比較ではモデルごとのメモリは未測定です。線分は中央値から p95 までを示します。Laya は Banking77 の選択肢を切り詰め、Kev はアダプター未統合の参照 CPU カーネルを使います。 完全な測定テーブルとプロトコル M4 CPU · FP32 · PyTorch イントラオペレーション/インターオペレーション 1/1 · BLAS リミット 1 · ミリ秒単位中央値 /p95 タスク | reflex-1 | OpenJev | Laya | Kev | Banking77 | 345.2/ 692.0 | 1332.6/ 2857.1 | 912.4/ 2649.9 | 4283.4/ 11073.7 | Emotion | 256.2/ 610.4 | 381.8/ 1029.5 | 240.1/ 427.7 | 1121.9/ 4422.3 | AG News | 321.7/ 578.7 | 424.5/ 934.0 | 324.1/ 760.5 | 1356.5/ 4997.2 | SST-5 | 299.1/ 631.0 | 360.5/ 894.5 | 250.7/ 548.5 | 902.2/ 4480.5 | BoolQ | 463.4/ 1329.1 | 451.9/ 1398.9 | 440.4/ 1587.9 | 1775.3/ 6548.0 | ネイティブランタイム予算。Laya はBanking77のオプションを現地の予算で切り捨てています。予算拡大の結果は別途報告されます。KevはCPUリファレンスカーネルと統合されていないアダプターを使用しています。2026-09-24に録音されました。 Reflex-1 測定メモリ:1.50 GiB ピークプロセスRSS元の120個の入力を個別にReflex-1リソースで再生し、それぞれ2回のスコアを付けます。プロセス全体のピーク RSS には、インポート、モデルの読み込み、ウォームアップ、推論が含まれます。元の4つのモデルのレイテンシ比較では、モデルごとのメモリは記録されませんでした。UTC 2026-10-02 UTCを記録しました。[リソース測定とプロトコル](https://huggingface.co/Goodailabs/reflex-1/resolve/main/assets/cpu-resources.json)。 Banking77 では 77 個の意図から選択します。同じ測定で、reflex-1 の中央値は 345.2 ms、OpenJev は 1,332.6 ms でした。5 つのタスクにおける reflex-1 の中央値は 256.2〜463.4 ms でした。 Layaは、選択の少ないいくつかのタスクでより速かった。 ネイティブのBanking77予算ではオプションが切り捨てられていたため、そのタイミングは限られた候補セットを対象としていました。 Kevは、統合されていないアダプターを備えたCPUリファレンスカーネルを使用していました。 バックグラウンドラップトップのアクティビティがテールレイテンシーの拡大の一因となりました。 このテストはモデルを読み込んだ状態で、リクエストの構築から正規化した出力までを計測しています。CPU と GPU では異なるリクエストを使っているため、この時間から CPU に対する GPU の速度向上率を直接算出することはできません。 ### 学習済みタスクの精度 reflex-1はBanking77 で95.0%、Emotion で92.2%のスコアを記録しました。 両者で比較したチェックポイントで首位に立ち、AG News sとSST-5で最高得点を記録し、 BoolQではOpenJevをわずかに下回りました。 意思決定の正確さ タスクあたり500例・開発診断 Banking77 精度 (%)・高いほど良い記録値 - Reflex-1 95.0% - OpenJev 90.6% - Laya・ネイティブ 44.4% - Laya・エクスパンデッド 55.4% - Kev 82.4% 050100 Emotion 精度 (%)・高いほど良い記録値 - Reflex-1 92.2% - OpenJev 53.0% - Laya・ネイティブ 57.6% - Laya・エクスパンデッド 57.6% - Kev 54.4% 050100 AG News 精度 (%)・高いほど良い記録値 - Reflex-1 91.2% - OpenJev 77.4% - Laya・ネイティブ 91.2% - Laya・エクスパンデッド 91.2% - Kev 87.2% 050100 SST-5 精度 (%)・高いほど良い記録値 - Reflex-1 59.8% - OpenJev 59.8% - Laya・ネイティブ 51.0% - Laya・エクスパンデッド 51.0% - Kev 55.2% 050100 BoolQ 精度 (%)・高いほど良い記録値 - Reflex-1 86.0% - OpenJev 86.8% - Laya・ネイティブ 71.2% - Laya・エクスパンデッド 71.2% - Kev 82.6% 050100 タスクファミリーはトレーニングに含まれ、これらのサブセットは開発中に検査されました。トレーニング露出はモデルによって異なります。Layaのネイティブ予算では、Banking77のオプションが切り捨てられています。 各モデルは、タスクごとに同じ500個のサンプルを受け取りました。これらのタスクファミリーはReflex ストレーニングに含まれ、サブセットは開発中に検査されました。トレーニング露出はモデルによって異なります。予算を拡張したLaya 77のBanking77ラベルをすべて保有しています。 完全な測定テーブルとプロトコル 精度 (%)・タスクあたり500例・開発診断 タスク | reflex-1 | Laya、ネイティブ | Laya、拡張 | OpenJev | Kev | Banking77 | 95.0 | 44.4 | 55.4 | 90.6 | 82.4 | Emotion | 92.2 | 57.6 | 57.6 | 53.0 | 54.4 | AG News | 91.2 | 91.2 | 91.2 | 77.4 | 87.2 | SST-5 | 59.8 | 51.0 | 51.0 | 59.8 | 55.2 | BoolQ | 86.0 | 71.2 | 71.2 | 86.8 | 82.6 | Laya SDK 0.3.20は、ネイティブおよび拡張トークンのバジェットで表示されます。Banking77のネイティブバジェットではオプションセットが切り捨てられ、拡張された予算では77のラベルすべてが残ります。これらは開発診断であり、独立した移転評価ではありません。 これらはタスクあたり500例の診断でした。 タスクファミリーはトレーニングに含まれ、開発中にサブセットを検査しました。 トレーニング予算と過去の経験はモデルによって異なります。その他の例では、 精度はレイテンシとは別に測定されました。 ジェネラルチェックポイントは、 カスタムブラウザコントローラーを使用して80回のトライアルのうち0回を完了しました。その結果、 使い慣れたタスク分類と自律制御との間に大きなギャップがあることが明らかになった。 なじみのない質問に移り、確率キャリブレーションは未解決の評価問題のままです。 ### トレーニングと保管 アダプターのマージ後、サービングモデルには420,778,370のパラメーターがあります。 ModernBERTは状態と質問をエンコードし、フリーズしたMiniLM エンコーダーは選択肢を表します。共有ヘッドはそれらの表現を組み合わせます。 reflex-1・サービングサイズと適応予算 資源 | 記録された構成 | サービングパラメーター | 420,778,370 | 適応訓練を受けたパラメーター | 9,036,290 | アダプテーションハードウェア | 1 × エヌビディア H200 | メインラン | 6,000 件のアップデート·75 分 7 秒 | ディスク上に抽出された FP32 モデル | ≈ 1.69 GB | 測定された CPU プロセスメモリ | 1.50 GiB ピーク RSS · 240 リクエストによる個別のリプレイ | CPU 計算スレッド | PyTorch イントラオペレーション/インターオペレーション 1/1 · BLAS リミット 1 | 主な適応実行では、8つのタスクファミリーの290,657件のレコードを使用して 、6,000ステップにわたって9,036,290のパラメーターを更新しました。開発画面とチェックポイントセーブを含めて、 1台のH200で75分7秒かかりました。 基本モデルの事前トレーニング、データ準備、予測フィッティング、 および以前の実験には追加コストが発生します。 展開した FP32 モデルはディスク上で約 1.69 GB を占めます。別途行った CPU リソース測定では、フレームワークの割り当て、トークナイザー、読み込み、ウォームアップ、推論を含むプロセスの最大常駐メモリ(RSS)が 1.50 GiB でした。GPU メモリ使用量は未測定です。 ## モデルアクセス [Hugging Face の公開リリースには](https://huggingface.co/gai-labs/reflex-1)、1.68 GBのFP32ウェイト、両方のトークナイザー、およびApache 2.0での自己完結型のTransformers 実装が含まれています。 アカウント、API キー、 GitHub へのアクセスは必要ありません。Python 3.12 を使う: ``` python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0" ``` ``` import torch from transformers import AutoModel torch.set_num_threads(1) model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True) decision = model.predict( state="The customer was charged twice for one card payment.", question="Choose the matching issue.", options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"], )[0] print(decision.choice) ``` モデルを一度読み込んで再利用します。モデルカードには、バッチ推論、 複数の質問、オフラインロード、リリースハッシュが記載されています。 開発リポジトリは非公開のままです。 公開パッケージには推論に必要なコードが含まれています。 元の訓練には RACE と SciQ を使用しており、それぞれの条件に非商用制限が含まれます。[モデルカード](https://huggingface.co/gai-labs/reflex-1)に利用方法と固定リビジョンを記載しています。出典の監査は、その条件が訓練済み重みにどう適用されるかを確定するものではありません。 ## 記録と再現方法 録画を再現するには、[十月 3 日の固定 Hub リビジョン](https://huggingface.co/gai-labs/reflex-1/tree/ae50bf81cddcaaac2aa18021d862433ca69da197)を使用してください。上の図には既存能力の低下も含めた測定結果を残しています。各録画は環境、入力形式、再生速度を明示しています。 現在のリリースの評価はモデルカードから参照できます。これらの録画と研究では元の結果を保持しています。 研究中も ## 研究中も - ### [Samsara-VLA](https://www.goodailabs.com/ja/research/samsara-vla/) 言語で指示する操作向けの、2つのコンパクトなロボットポリシー。つかむ、置く、開ける、複数手順のタスクを完了する様子をご覧ください。 - ### [VIO-lens-2](https://www.goodailabs.com/ja/research/vio-lens-2/) 研究中。 通信 ## 私たちに書いてください 評価、モデルアクセス、共同研究についてはお問い合わせください。 [research@goodailabs.com](mailto:research@goodailabs.com?subject=Reflex-1)