繁
聯絡
選單

研究 公開權重

Reflex-1

面向智慧體的決策模型

面向智慧體的 421M 引數決策模型。在 CPU 或 GPU 上,一次前向傳播即可完成評分。

微調後的權重已在 Hugging Face 提供。

概覽

許多代理決策都以一個選擇告終:哪個佇列接收請求, 哪個工具適合任務,或者接下來要執行哪個操作。Reflex-1在一次正向傳遞 中對您的應用程式提供的選擇進行評分。它返回 機率分佈,應用程式可以使用該分佈來做出決定。

本研究沿著 Jev 探索的決策模型方向,採用不同的架構與監督訓練流程。28 層上下文編碼器和六層候選編碼器連接至共用評分頭。目前的檢查點更新了全部 420,778,370 個參數。

預設公開下載的是最新微調檢查點。其模型卡包含目前的評估結果與 CPU 測量。下方註明日期的研究與錄影保留其原始檢查點識別資訊。

決策模型

公開版本 · 執行環境 1.0.0
使用
從應用程式提供的選項中進行選擇:標籤、路線或可能的操作。
輸入 → 輸出
狀態、問題和 1—255 個選項 → 一次正向傳遞中的選擇分佈。
模型
421M 參數。28 層上下文編碼器、6 層候選編碼器和共用評分頭。
在本地執行
CPU 或 GPU · FP32。目前 CPU 重播在一個或四個運算執行緒下測得 2.17 GiB 的程序尖峰記憶體。
評估
在 495 筆 Banking77 保留樣本上達到 92.93%;原生 MiniWoB++ 完成 21/30 個回合。這些任務類型在訓練中有涵蓋。
獲取方式
Apache 2.0 下的公共權重、分詞器和推理程式碼。英文文字;執行時間 1.0.0。

預設下載的是最新微調檢查點。下方註明日期的研究與錄影對應較早的檢查點。應用程式負責提供候選項並控制執行。

目前結果

10 月 5 日發布的模型使用固定控制器,完成了 21/30 個原生 MiniWoB++ 瀏覽器回合。在 495 個 Banking77 樣本上的準確率為 92.93%。這些是訓練中已涉及之任務類別的保留子集,並非完整基準成績。

10 月 5 日檢查點 · 保留的分類評估子集
任務答對 / 評估數量準確率
AG News465 / 50093.00%
SST-5299 / 50059.80%
Emotion458 / 50091.60%
Banking77460 / 49592.93%
BoolQ171 / 20284.65%
MNLI436 / 50087.20%
RACE287 / 50057.40%
SciQ123 / 12896.09%

在 Intel Xeon Platinum 8558 CPU 上,使用四個運算執行緒時,Banking77 推論的中位延遲為 375.2 ms,p95 為 452.1 ms。包含載入、暖機與推論,程序記憶體峰值為 2.17 GiB。

目前的 CPU 測量結果

Intel Xeon Platinum 8558 · FP32 · 批次大小 1

一個運算執行緒

延遲 · 越低越快中位數/p95
  1. AG News 1209.7 / 1385.0 ms
  2. SST-5 973.6 / 1160.3 ms
  3. Emotion 956.9 / 1165.8 ms
  4. Banking77 1101.7 / 1276.9 ms
  5. BoolQ 1600.8 / 2710.6 ms

四個運算執行緒

延遲 · 越低越快中位數/p95
  1. AG News 389.5 / 480.4 ms
  2. SST-5 320.6 / 404.2 ms
  3. Emotion 318.8 / 391.0 ms
  4. Banking77 375.2 / 452.1 ms
  5. BoolQ 486.7 / 782.2 ms

每種執行緒設定在兩個新程序中,對 120 個輸入執行 480 次呼叫。計時包含斷詞與推論,不含載入與暖機。使用共用主機與評估執行環境,不使用跨請求快取。

完整評估尚未完成。BoolQ、RACE 與公開 JevBench 診斷的表現較上一檢查點下降;原生 Dino 在 0/16 次嘗試中達到 60 秒目標。目前 GPU 延遲尚未測量。已發布的評估記錄了檢查點、測試條件與尚未完成的項目。

它是如何運作的

每個請求都提供候選答案。該模型在其代幣限制範圍內支援每個問題 1—255 個 選項,並且多個問題可以 共享一個壓縮狀態。支援應用程式可以提供自己的佇列; 代理可以提供其可用工具的描述。新的決策 型別需要自己的準確性測試。

模型對提供的選項進行評分;應用程式構造工具引數 並決定允許哪些操作。狀態文字的上限為 512 個 上下文令牌生成器令牌,並且可以透過請求預算進一步縮短。 每個選項最多可接受 512 個期權代幣生成器代幣。檢查state_truncated 何時可能縮短了上下文。

Reflex-1/決策模型

從問題到選擇。

  1. 01 / 輸入

    定義決策。

    您的應用程式提供了狀態、問題及其可以據以採取行動的選擇。這些選擇可能會隨著每個請求而改變:支援佇列、可用工具或允許的操作。

    狀態 + 問題

    客戶被收取了兩次費用。
    哪個問題匹配?

    重複收費丟失的卡未知費用現金提取
    背景 + 問題ModernBERT
    每種選擇MiniLM
    共享得分頭選擇機率
    應用程式許可權 → 論點 → 操作
    說明性支援請求。應用程式定義候選集合。
  2. 02 / 編碼

    代表背景和候選人。

    經過改編的ModernBERT編碼器可以讀取狀態和問題。凍結的 MiniLM 編碼器代表每個提供的選項。幾個問題可以共享一個擁擠的狀態。

    狀態 + 問題

    客戶被收取了兩次費用。
    哪個問題匹配?

    重複收費丟失的卡未知費用現金提取
    背景 + 問題ModernBERT
    每種選擇MiniLM
    共享得分頭選擇機率
    應用程式許可權 → 論點 → 操作
    兩個編碼器為一個共享的計分頭供電。這是預覽架構的示意圖。
  3. 03 / 評分

    在一輪比賽中為所有提供的選項打分。

    共享頭部將上下文和候選表示形式組合在一起,然後返回所提供選擇的機率分佈。新的決策型別仍然需要準確性和校準測試。

    狀態 + 問題

    客戶被收取了兩次費用。
    哪個問題匹配?

    重複收費丟失的卡未知費用現金提取
    背景 + 問題ModernBERT
    每種選擇MiniLM
    共享得分頭選擇機率
    應用程式許可權 → 論點 → 操作
    每個提供的候選人一個分數,歸一化為機率分佈。
  4. 04 / 行動

    讓應用程式執行決定。

    應用程式決定允許哪些操作,構造任何工具引數並執行所選操作。Reflex-1提供分數;周圍的系統擁有控制迴路。

    狀態 + 問題

    客戶被收取了兩次費用。
    哪個問題匹配?

    重複收費丟失的卡未知費用現金提取
    背景 + 問題ModernBERT
    每種選擇MiniLM
    共享得分頭選擇機率
    應用程式許可權 → 論點 → 操作
    應用程式邊界很重要:對工具進行評分並不能執行該工具。

公共開發預覽版的架構。支援請求說明了輸入格式。

示例

下方範例與決策品質比較使用 10 月 3 日的快照。速度與資源測量另行標註。每段錄影保留實際結局,包括失敗。

Chromium Dino

本錄屏使用 Chromium 原版 chrome://dino 遊戲。Reflex-1 接收當前可見障礙物的幾何資訊,選擇奔跑、跳躍或下蹲。原生鍵盤事件執行這些選擇,推理期間遊戲時鐘持續執行。影片以正常速度展示真實瀏覽器畫面。

Reflex-1 · 原版 Chromium43.6 秒 無聲影片
Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 遊戲中使用引擎可見幾何資訊的結構化輸入。這是 2026 年 10 月 3 日開發快照。獨立賽道的完整錄屏在 42.309 秒發生碰撞時結束(得分 535),未完成 60 秒時限。推理期間瀏覽器持續執行。 正常速度的瀏覽器錄屏;推理期間遊戲時鐘持續執行。

該快照的兩次嘗試分別在 42.31 秒和 30.41 秒後發生碰撞,均未達到 60 秒上限。較長的一次先展示。兩次使用獨立隨機賽道,不能據此進行配對模型比較。下方保留完整的第二次嘗試。

觀看第二次 Dino 嘗試
Reflex-1 · 原版 Chromium31.8 秒 無聲影片
Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 遊戲中使用引擎可見幾何資訊的結構化輸入。這是 2026 年 10 月 3 日開發快照。獨立賽道的完整錄屏在 30.410 秒發生碰撞時結束(得分 351),未完成 60 秒時限。推理期間瀏覽器持續執行。 正常速度的瀏覽器錄屏;推理期間遊戲時鐘持續執行。

ViZDoom

遊戲為原生 ViZDoom 的 Defend the Center 場景,難度為 5。Reflex-1 根據可見物件邊界、生命值與彈藥量選擇動作。這是結構化狀態控制器,並非從畫素推斷動作。下方保留最初預先指定的示例,僅展示 Reflex-1 視角。

Reflex-1 · 原生 ViZDoom36.5 秒 無聲影片
Reflex-1 · ViZDoom. Reflex-1 在原生 ViZDoom 1.3.1 的 Defend the Center 場景中執行,難度為 5。2026 年 10 月 3 日開發快照;預先指定的錄製種子為 510001。完整回合在規定 45 秒模擬時間中的 34.514 秒時死亡結束,擊殺 30 個敵人。模型接收引擎可見標籤與生命值/彈藥量,不接收畫素。播放遵循錄製的模擬時間,不包含推理延遲。 按模擬時間播放,不包含推理延遲;保留原始終止畫面的停留時間。

在全部 32 個預留回合中,該快照平均擊殺 18.88 個敵人,存活 22.47 秒。所有回合都在 45 秒上限前結束。圖表保留全部外部對比模型與完整回合計數。

ViZDoom · 擊殺數與生存限制

2026 年 10 月 3 日 · 開發快照 70a843878214

Defend the Center · 難度 5

擊殺數 · 越高越好均值 · 95% 區間
  1. Reflex-10/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 22.47 s 18.995% 置信區間 16.6–21.2
  2. Laya0/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 4.90 s 1.495% 置信區間 1.2–1.6
  3. OpenJev · DeBERTa0/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 4.90 s 1.495% 置信區間 1.2–1.6
  4. Kev-0.8B0/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 4.90 s 1.495% 置信區間 1.2–1.6

此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 原版 ViZDoom 引擎,結構化可見狀態輸入,直接執行 argmax 動作;每回合上限 45 秒。保留全部宣告結果。均值區間對配對種子重取樣 10,000 次。預留回合種子不能證明結構化狀態未被見過。這是指定介面卡/環境下的比較,並非官方基準得分或畫素輸入策略評估。

Reflex-1 平均擊殺 18.88 個敵人、存活 22.47 秒,完整時長完成數為 0/32。Laya、OpenJev 與 Kev 均平均擊殺 1.375 個,也均完成 0/32。參考模型按原發布版本使用,訓練經歷不同。

瀏覽器工作流

這些是隨 Laya Browser 分發、在本地託管的合成 WebGym 站點。瀏覽器狀態在真實 Chromium 中捕獲,成功與否由原始任務檢查器判定。Reflex-1 選擇動作與目標,共用的 Qwen3-1.7B 輔助模型提供輸入文字和下拉框值。結果衡量的是這一完整系統。

Reflex-1 · 合成 WebGym30.1 秒 · 4× 無聲影片
餐廳預訂 · 任務完成. 10 月 3 日開發快照;15 個動作。在 Chromium 中捕獲瀏覽器狀態,以實際時間的 4× 速度回放,保留完整結局與終止畫面的停留。 本地合成任務,共用 Qwen3-1.7B 文字輔助模型。該快照與 Hub 預設權重不同。
Reflex-1 · 合成 WebGym8.1 秒 · 4× 無聲影片
購物任務 · 目標未完成. 10 月 3 日開發快照;4 個動作。在 Chromium 中捕獲瀏覽器狀態,以實際時間的 4× 速度回放,保留完整結局與終止畫面的停留。 本地合成任務,共用 Qwen3-1.7B 文字輔助模型。該快照與 Hub 預設權重不同。

餐廳任務成功,購物任務失敗。兩者使用同一預先指定的任務種子,保留錄製結局。影片按原始實際時間的 4× 速度回放瀏覽器狀態,並保留終止畫面的停留時間。這些是合成站點上的開發結果,不是 MiniWoB++、WebArena 或真實網站得分。

瀏覽器任務完成率 · 合成 WebGym

2026 年 10 月 3 日 · 開發快照 70a843878214
完成回合(%)· 越高越好記錄的價值
  1. Reflex-1485 次決策呼叫(0 次錯誤)· 102 次輔助模型呼叫(0 次 HTTP 錯誤 / 5 次介面約定錯誤) 13/35
  2. Laya Browser505 次決策呼叫(0 次錯誤)· 100 次輔助模型呼叫(0 次 HTTP 錯誤 / 7 次介面約定錯誤) 17/35
  3. Laya56 次決策呼叫(0 次錯誤)· 12 次輔助模型呼叫(0 次 HTTP 錯誤 / 0 次介面約定錯誤) 0/35
  4. OpenJev · DeBERTa35 次決策呼叫(24 次錯誤)· 0 次輔助模型呼叫(0 次 HTTP 錯誤 / 0 次介面約定錯誤) 0/35
  5. Kev-0.8B196 次決策呼叫(0 次錯誤)· 82 次輔助模型呼叫(0 次 HTTP 錯誤 / 0 次介面約定錯誤) 1/35

此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 本地合成 WebGym 站點的真實 Chromium 錄屏。每個對照組使用相同執行器、Qwen3-1.7B 文字輔助模型與 40 步上限。Reflex-1 使用 BF16 autocast,狀態/請求詞元上限為 1,024 / 16,384;其他執行條件保留在下載中。保留各組全部 35 次嘗試、請求失敗與輔助模型錯誤。本圖與 MiniWoB++、WebArena 和真實網站評估分開。

源站點的最終狀態檢查記錄 Reflex-1 完成 13/35,Laya Browser 完成 17/35。專用模型仍然領先;圖中也展示另外三個外部對照組。

本研究中 Reflex-1 完成 13/35 項任務,Laya Browser 完成 17/35。分母保留所有嘗試、失敗與模型請求錯誤。之後在官方 MiniWoB++ 環境進行的小規模試驗中,該快照完成 0/30 項任務,因此不能把合成站點結果視為該基準上的成功。

決策質量

Typed Decisions 涵蓋客戶支援、發票處理、安全告警和智慧體執行軌跡。評估保留原始狀態分組,透過統一選項介面要求各模型完成相同的五項判斷。Reflex-1 正確完成 1,508/2,000 項判斷(75.4%)。

結構化決策

2026 年 10 月 3 日 · 開發快照 70a843878214

客戶支援

精度 (%) · 越高越好準確率 · 95% 區間
  1. Reflex-1383/500 正確 · 0 次錯誤 · 0 次狀態截斷 76.6%95% 置信區間 72.0–80.8%
  2. Laya · native210/500 正確 · 0 次錯誤 · 39 次狀態截斷 42.0%95% 置信區間 38.2–45.8%
  3. OpenJev · DeBERTa206/500 正確 · 0 次錯誤 · 350 次狀態截斷 41.2%95% 置信區間 37.8–44.0%
  4. Kev-0.8B314/500 正確 · 0 次錯誤 · 10 次狀態截斷 62.8%95% 置信區間 58.2–67.4%

發票處理

精度 (%) · 越高越好準確率 · 95% 區間
  1. Reflex-1394/500 正確 · 0 次錯誤 · 0 次狀態截斷 78.8%95% 置信區間 75.0–82.4%
  2. Laya · native192/500 正確 · 0 次錯誤 · 0 次狀態截斷 38.4%95% 置信區間 32.6–44.6%
  3. OpenJev · DeBERTa203/500 正確 · 0 次錯誤 · 500 次狀態截斷 40.6%95% 置信區間 38.2–43.0%
  4. Kev-0.8B252/500 正確 · 0 次錯誤 · 0 次狀態截斷 50.4%95% 置信區間 45.2–55.8%

安全告警

精度 (%) · 越高越好準確率 · 95% 區間
  1. Reflex-1362/500 正確 · 0 次錯誤 · 0 次狀態截斷 72.4%95% 置信區間 68.4–76.2%
  2. Laya · native167/500 正確 · 0 次錯誤 · 0 次狀態截斷 33.4%95% 置信區間 30.0–37.0%
  3. OpenJev · DeBERTa210/500 正確 · 0 次錯誤 · 275 次狀態截斷 42.0%95% 置信區間 39.2–44.6%
  4. Kev-0.8B236/500 正確 · 0 次錯誤 · 0 次狀態截斷 47.2%95% 置信區間 42.6–51.8%

智慧體執行軌跡

精度 (%) · 越高越好準確率 · 95% 區間
  1. Reflex-1369/500 正確 · 0 次錯誤 · 0 次狀態截斷 73.8%95% 置信區間 69.0–78.4%
  2. Laya · native193/500 正確 · 0 次錯誤 · 0 次狀態截斷 38.6%95% 置信區間 33.4–44.0%
  3. OpenJev · DeBERTa192/500 正確 · 0 次錯誤 · 0 次狀態截斷 38.4%95% 置信區間 34.6–42.2%
  4. Kev-0.8B179/500 正確 · 0 次錯誤 · 0 次狀態截斷 35.8%95% 置信區間 31.6–40.4%

此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 400 個預留源狀態擴充套件為 2,000 項判斷,每個工作流含 500 項。區間透過重取樣源狀態得到,同時保留五個關聯輸出頭。 詞元上限:Reflex-1: 狀態 1,024, 請求 4,096; Laya · 原生: 請求 512, 指令/選項 192; OpenJev · DeBERTa: 狀態 256, 請求 512; Kev-0.8B: 狀態 512, 分支(包含狀態)2,048。 全評估群體的指令/選項縮短次數(不能把各任務圖表相加):Laya · 原生 0/2,000。這些計數與上方的狀態截斷次數分開。

透過統一選項介面,衡量與教師模型最常見選擇的一致率。這是適配後的資料集結果,並非官方多頭任務排行榜得分。

在預留的 CLINC 請求集中,Reflex-1 正確處理 3,680/4,490 個意圖與範圍外請求(82.0%)。陌生工具選擇為 72/87,低於外部模型的最佳結果 82/87。下方同時展示優勢與差距。

意圖路由

2026 年 10 月 3 日 · 開發快照 70a843878214

已知與陌生請求

精度 (%) · 越高越好準確率 · 95% 區間
  1. Reflex-13,680/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 64 次誤拒 · 370 次誤接受 82.0%95% 置信區間 80.8–83.1%
  2. Laya · native1,425/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 0 次誤拒 · 942 次誤接受 31.7%95% 置信區間 30.3–33.2%
  3. Laya · 擴充套件版1,017/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 0 次誤拒 · 942 次誤接受 22.7%95% 置信區間 21.4–23.9%
  4. OpenJev · DeBERTa2,496/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 5 次誤拒 · 939 次誤接受 55.6%95% 置信區間 54.1–57.0%
  5. Kev-0.8B2,298/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 1 次誤拒 · 937 次誤接受 51.2%95% 置信區間 49.6–52.6%

此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 4,490 個預留請求:3,548 個已知意圖請求與 942 個範圍外請求。同時展示原生 Laya 與單獨宣告的擴充套件上下文對照。 詞元上限:Reflex-1: 狀態 1,024, 請求 4,096; Laya · 原生: 請求 512, 指令/選項 192; Laya · 擴充套件: 請求 2,048, 指令/選項 1,536; OpenJev · DeBERTa: 狀態 256, 請求 512; Kev-0.8B: 狀態 512, 分支(包含狀態)2,048。 全評估群體的指令/選項縮短次數(不能把各任務圖表相加):Laya · 原生 4,490/4,490;Laya · 擴充套件 0/4,490。這些計數與上方的狀態截斷次數分開。

Reflex-1 正確路由 3,108/3,548 個已知意圖請求,並拒絕 572/942 個範圍外請求。它誤拒 64 個已知請求,誤接受 370 個範圍外請求。保留全部外部模型條件。

陌生工具選擇

2026 年 10 月 3 日 · 開發快照 70a843878214

工具選擇

精度 (%) · 越高越好準確率 · 95% 區間
  1. Reflex-172/87 正確 · 0 次錯誤 · 0 次狀態截斷 82.8%95% 置信區間 74.7–90.8%
  2. Laya · native80/87 正確 · 0 次錯誤 · 14 次狀態截斷 92.0%95% 置信區間 86.2–97.7%
  3. Laya · 擴充套件版80/87 正確 · 0 次錯誤 · 0 次狀態截斷 92.0%95% 置信區間 86.2–97.7%
  4. OpenJev · DeBERTa82/87 正確 · 0 次錯誤 · 30 次狀態截斷 94.3%95% 置信區間 88.5–98.9%
  5. Kev-0.8B81/87 正確 · 0 次錯誤 · 1 次狀態截斷 93.1%95% 置信區間 87.4–97.7%

此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 87 個預留請求,其工具名稱與規範化狀態在訓練前分離。這是工具選擇適配,不涉及引數生成或執行。 詞元上限:Reflex-1: 狀態 1,024, 請求 4,096; Laya · 原生: 請求 512, 指令/選項 192; Laya · 擴充套件: 請求 2,048, 指令/選項 1,536; OpenJev · DeBERTa: 狀態 256, 請求 512; Kev-0.8B: 狀態 512, 分支(包含狀態)2,048。 全評估群體的指令/選項縮短次數(不能把各任務圖表相加):Laya · 原生 87/87;Laya · 擴充套件 65/87。這些計數與上方的狀態截斷次數分開。

Reflex-1 正確選擇 72/87 個工具。Laya 在每個已宣告條件下均為 80/87,OpenJev 為 82/87,Kev 為 81/87。該測試僅評估給定工具中的選擇,不涵蓋引數生成或執行。

這些是使用已宣告評估群體的統一選項適配,並非官方排行榜提交。外部模型按原發布版本評估,未接受 Reflex-1 的任務專項訓練。圖表保留原始不確定性區間、詞元預算和截斷計數。

速度與資源

本節測量對應 10 月 2 日的檢查點。目前檢查點的測量可在上方連結的模型卡中查看。

H200 請求延遲

我們在共享的 NVIDIA H200 上為每個型號重播了 120 個不同的請求。 它們來自五個遊戲和瀏覽器環境。每個模型都收到 相同的輸入,一次只能發出一個請求。

H200 請求延遲

120 次輸入·兩次重複·一個請求正在執行
毫秒·越低越快中位數/p95
  1. Reflex-1FP32 27.5 / 30.5
  2. OpenJevFP32 32.0 / 33.8
  3. Laya(原生)BF16 27.1 / 142.0
  4. Laya(FP32 重播)FP32 40.2 / 44.4

點:中位數。行尾:p95。包括令牌化、評分和環回 HTTP;不包括載入和預熱。

120 個相同的輸入,每個輸入重播兩次,一個請求正在進行中。計時包括格式化、標記化、推理和環回 HTTP。跨度顯示的中位數為 p95。精度因標籤而異;FP32 Laya重播改變了兩個決定。
完整的測量表和協議
H200 · 相同的請求·延遲以毫秒為單位·越低越好
模型計算資源中位數p95
reflex-1FP3227.530.5
OpenJevFP3232.033.8
Laya(原生)BF1627.1142.0
Laya(FP32 重播)FP3240.244.4

Laya原生使用BF16自動播放;還包括單獨的FP32重播。OpenJev 是 DeBerta 的公共檢查點,而不是託管的 Jev。這些請求時間不能衡量任務成功率或併發吞吐量。錄製於 2026-09-29。

reflex-1 的延遲中位數為 27.5 ms,p95 為 30.5 ms。它快於 FP32 下的 OpenJev,也快於另一次 FP32 回放中的 Laya。Laya 原生配置使用 BF16 autocast,中位數略低。由於使用共享機器且樣本有限,不能對接近的結果作過度推斷。

計時器包括標記化、模型評分、輸出標準化和環 回 HTTP。它不包括載入和三個預熱請求。答案和 選項快取已禁用。在這次執行中,我們沒有測量併發服務 吞吐量。這裡的 OpenJev 是 DeBerta 的公共檢查點; 它不是託管的 Jev 服務。

M4 CPU 延遲

CPU 測試使用了 MacBook Air M4、FP32 和批次大小 1。每個模型使用 一個 PyTorch 操作內執行緒、一個操作間執行緒和一個 BLAS 執行緒限制。 每項任務有 24 個不同的案例,每個案例重複 兩次。模型順序在八個執行塊中進行了平衡。

M4 CPU 請求延遲

FP32 · 第一批·PyTorch 執行緒 1/1 · BLAS 限制 1

Banking77

毫秒·對數刻度·越小越快中位數/p95
  1. Reflex-1 345.2 / 692.0
  2. OpenJev 1,332.6 / 2,857.1
  3. Laya 912.4 / 2,649.9
  4. Kev 4,283.4 / 11,073.7

Emotion

毫秒·對數刻度·越小越快中位數/p95
  1. Reflex-1 256.2 / 610.4
  2. OpenJev 381.8 / 1,029.5
  3. Laya 240.1 / 427.7
  4. Kev 1,121.9 / 4,422.3

AG News

毫秒·對數刻度·越小越快中位數/p95
  1. Reflex-1 321.7 / 578.7
  2. OpenJev 424.5 / 934.0
  3. Laya 324.1 / 760.5
  4. Kev 1,356.5 / 4,997.2

SST-5

毫秒·對數刻度·越小越快中位數/p95
  1. Reflex-1 299.1 / 631.0
  2. OpenJev 360.5 / 894.5
  3. Laya 250.7 / 548.5
  4. Kev 902.2 / 4,480.5

BoolQ

毫秒·對數刻度·越小越快中位數/p95
  1. Reflex-1 463.4 / 1,329.1
  2. OpenJev 451.9 / 1,398.9
  3. Laya 440.4 / 1,587.9
  4. Kev 1,775.3 / 6,548.0

點表示中位數,線段末端表示 p95。所有任務使用同一對數刻度。記憶體:單獨的 Reflex-1 回放測得峰值程序 RSS 為 1.50 GiB;本次比較未逐個測量各模型的記憶體。

FP32,批次大小為一;PyTorch 操作內/操作間執行緒數為 1/1,BLAS 執行緒數上限為 1。原始延遲測試中,每項任務有 24 個輸入,各重複兩次。單獨對 Reflex-1 進行的 240 次請求回放測得峰值程序 RSS 為 1.50 GiB,涵蓋載入、預熱和推理。原始比較未記錄各模型的記憶體。線段表示中位數至 p95 的範圍。Laya 會截斷 Banking77 的候選選項;Kev 使用未合併介面卡的參考 CPU 核心。
完整的測量表和協議
M4 CPU · FP32 · PyTorch 操作內/操作間隔 1/1 · BLAS 限制 1 · 中位數/p95 以毫秒為單位
任務reflex-1OpenJevLayaKev
Banking77345.2/ 692.01332.6/ 2857.1912.4/ 2649.94283.4/ 11073.7
Emotion256.2/ 610.4381.8/ 1029.5240.1/ 427.71121.9/ 4422.3
AG News321.7/ 578.7424.5/ 934.0324.1/ 760.51356.5/ 4997.2
SST-5299.1/ 631.0360.5/ 894.5250.7/ 548.5902.2/ 4480.5
BoolQ463.4/ 1329.1451.9/ 1398.9440.4/ 1587.91775.3/ 6548.0

原生執行時預算。Laya按其原有預算截斷了Banking77的期權;擴大的預算結果將單獨報告。Kev 使用其 CPU 參考核心和未合併的介面卡。錄製於 2026-09-24。

Reflex-1 實測記憶體:1.50 GiB 峰值程序 RSS。對最初的120個輸入進行單獨的Reflex-1資源回放,每個輸入都得分兩次。全過程峰值 RSS 包括匯入、模型載入、預熱和推理。最初的四種模型延遲比較沒有記錄每個模型的記憶體。錄製於 2026-10-02 UTC。資源測量和協議。

Banking77 要求模型從 77 種意圖中選擇。reflex-1 的延遲中位數為 345.2 ms,同一次測試中 OpenJev 為 1,332.6 ms。五項任務中,reflex-1 的中位數在 256.2 至 463.4 ms 之間。

Laya 完成了幾項小選擇的任務,速度更快。其原生Banking77預算截斷了期權,因此其時機涵蓋了縮減的候選組合。 Kev 使用了帶有未合併介面卡的 CPU 參考核心。後臺 膝上型電腦活動導致尾部延遲擴大。

本測試在模型已載入的條件下,計時從構建請求到返回規範化輸出的全過程。CPU 和 GPU 測試使用不同的請求,不能根據這些時間直接計算 CPU 到 GPU 的加速比。

熟悉任務的準確率

reflex-1在Banking77的得分為95.0%,在Emotion上得分為92.2%。它在兩個 檢查點的比較中均處於領先地位,在AG News和SST-5 上並列最佳分數,在BoolQ上的得分 略低於OpenJev。SST-5

決策準確性

每項任務 500 個示例·開發診斷

Banking77

精度 (%) · 越高越好記錄的價值
  1. Reflex-1 95.0%
  2. OpenJev 90.6%
  3. Laya · native 44.4%
  4. Laya · 擴充套件版 55.4%
  5. Kev 82.4%

Emotion

精度 (%) · 越高越好記錄的價值
  1. Reflex-1 92.2%
  2. OpenJev 53.0%
  3. Laya · native 57.6%
  4. Laya · 擴充套件版 57.6%
  5. Kev 54.4%

AG News

精度 (%) · 越高越好記錄的價值
  1. Reflex-1 91.2%
  2. OpenJev 77.4%
  3. Laya · native 91.2%
  4. Laya · 擴充套件版 91.2%
  5. Kev 87.2%

SST-5

精度 (%) · 越高越好記錄的價值
  1. Reflex-1 59.8%
  2. OpenJev 59.8%
  3. Laya · native 51.0%
  4. Laya · 擴充套件版 51.0%
  5. Kev 55.2%

BoolQ

精度 (%) · 越高越好記錄的價值
  1. Reflex-1 86.0%
  2. OpenJev 86.8%
  3. Laya · native 71.2%
  4. Laya · 擴充套件版 71.2%
  5. Kev 82.6%

任務組已納入訓練,在開發過程中對這些子集進行了檢查。訓練資料接觸情況因模型而異。Laya的原生預算減少了Banking77的期權。

每個模型每項任務收到相同的 500 個示例。這些任務系列包含在Reflex訓練中,並在開發過程中對子集進行了檢查。訓練資料接觸情況因模型而異。擴張預算的 Laya 保留了所有 77 個 Banking77 標籤。
完整的測量表和協議
準確度 (%) · 每項任務 500 個示例·開發診斷
任務reflex-1Laya,本地人Laya,已擴充套件OpenJevKev
Banking7795.044.455.490.682.4
Emotion92.257.657.653.054.4
AG News91.291.291.277.487.2
SST-559.851.051.059.855.2
BoolQ86.071.271.286.882.6

Laya SDK 0.3.20 顯示的是原生代幣預算和擴充套件代幣預算。原生 Banking77 預算截斷了選項集;擴充套件後的預算保留了所有 77 個標籤。這些是開發診斷,不是獨立的轉移評估。

這些是每項任務的 500 個診斷示例。任務系列已包含 在訓練中,我們在開發過程中檢查了子集。不同模型的訓練 預算和先前的曝光量有所不同。在更多示例中,精度與延遲是 分開測量的。

通用檢查點使用我們的定製 瀏覽器控制器完成了 80 次試驗中的 0 次。結果暴露了熟悉任務 分類和自主控制之間的巨大差距。轉到不熟悉的問題 ,機率校準仍然是未解決的評估問題。

訓練和儲存

合併介面卡後,服務模型有 420,778,370 個引數。 ModernBERT對狀態和問題進行編碼;凍結的 MiniLM 編碼器代表選擇。 共同的頭像組合了他們的表現形式。

reflex-1 · 服務規模和適應預算
資源已錄製的配置
服務引數420,778,370
在適應中訓練的引數9,036,290
適配硬體1 × NVIDIA H200
主跑6,000 次更新·75 分 7 秒
在磁碟上提取的 FP32 模型≈ 1.69 GB
測得的 CPU 程序記憶體1.50 GiB 峰值 RSS · 單獨回放 240 個請求
CPU 計算執行緒PyTorch 操作內/互操作 1/1 · BLAS 限制 1

主要改編執行使用了來自八個任務系列的290,657條記錄,在6,000個步驟中更新了9,036,290個引數。 在一個 H200 上花了 75 分 7 秒,包括開發螢幕和檢查點儲存。基礎模型 預訓練、資料準備、投影擬合和早期實驗 是額外的成本。

解壓後的 FP32 模型在磁碟上約佔 1.69 GB。單獨的 CPU 資源回放測得峰值程序 RSS 為 1.50 GiB,涵蓋框架分配、分詞器、載入、預熱和推理。GPU 記憶體佔用尚未測量。

模型訪問許可權

Hugging Face 的公開 版本包含 1.68 GB 的 FP32 權重、兩個代幣生成器和 Apache 2.0 下的自成 一體 Transformers 實現。無需賬戶、API 金鑰或 GitHub 訪問許可權。使用 Python 3.12:

python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0"
import torch
from transformers import AutoModel

torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)

decision = model.predict(
    state="The customer was charged twice for one card payment.",
    question="Choose the matching issue.",
    options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)

載入模型一次即可重複使用。模型卡記錄了批次推理、 多個問題、離線載入和釋出雜湊值。開發 倉庫保持私有狀態;公共包包含推理 所需的程式碼。

原始訓練使用了 RACE 和 SciQ,其來源條款包含非商業使用限制。模型卡記錄了使用情況和固定版本。來源審查並未確定這些條款如何適用於訓練後的權重。

錄屏與復現

使用 Hub 上十月 3 日的固定版本復現這些錄影。上方圖表保留了測得的結果,包括原有能力的退化。每段錄影均說明環境、輸入格式和播放速度。

目前版本的模型卡連結至獨立評估。這些錄影與研究保留其原始結果。

也在研究中

  • Samsara-VLA

    兩個用於語言條件操作的精簡機器人策略。觀看它們抓取、放置、開啟並完成多步驟任務。

  • VIO-lens-2

    研究進行中。

信函

寫信給我們

如需評估、模型訪問或研究合作,請聯絡我們。

research@goodailabs.com