[研究](https://www.goodailabs.com/zh-tw/research/) 公開權重 # Reflex-1 面向智慧體的決策模型 面向智慧體的 421M 引數決策模型。在 CPU 或 GPU 上,一次前向傳播即可完成評分。 微調後的權重已在 Hugging Face 提供。 [Hugging Face 上的模型和權重 ↗](https://huggingface.co/gai-labs/reflex-1) [探索模型 ↓](https://www.goodailabs.com/#project-details) [閱讀公告 ↗](https://www.goodailabs.com/zh-tw/blog/reflex-1-fast-decisions/) ## 概覽 許多代理決策都以一個選擇告終:哪個佇列接收請求, 哪個工具適合任務,或者接下來要執行哪個操作。Reflex-1在一次正向傳遞 中對您的應用程式提供的選擇進行評分。它返回 機率分佈,應用程式可以使用該分佈來做出決定。 本研究沿著 [Jev](https://docs.typesafe.ai/introduction) 探索的決策模型方向,採用不同的架構與監督訓練流程。28 層上下文編碼器和六層候選編碼器連接至共用評分頭。目前的檢查點更新了全部 420,778,370 個參數。 預設公開下載的是最新微調檢查點。其模型卡包含目前的評估結果與 CPU 測量。下方註明日期的研究與錄影保留其原始檢查點識別資訊。 決策模型 公開版本 · 執行環境 1.0.0 使用 從應用程式提供的選項中進行選擇:標籤、路線或可能的操作。 輸入 → 輸出 狀態、問題和 1—255 個選項 → 一次正向傳遞中的選擇分佈。 模型 421M 參數。28 層上下文編碼器、6 層候選編碼器和共用評分頭。 在本地執行 CPU 或 GPU · FP32。目前 CPU 重播在一個或四個運算執行緒下測得 2.17 GiB 的程序尖峰記憶體。 評估 在 495 筆 Banking77 保留樣本上達到 92.93%;原生 MiniWoB++ 完成 21/30 個回合。這些任務類型在訓練中有涵蓋。 獲取方式 Apache 2.0 下的公共權重、分詞器和推理程式碼。英文文字;執行時間 1.0.0。 預設下載的是最新微調檢查點。下方註明日期的研究與錄影對應較早的檢查點。應用程式負責提供候選項並控制執行。 [權重和推理 ↗](https://huggingface.co/gai-labs/reflex-1)[發布結果 ↗](https://www.goodailabs.com/zh-tw/research/reflex-1/#current-results) ## 目前結果 10 月 5 日發布的模型使用固定控制器,完成了 21/30 個原生 MiniWoB++ 瀏覽器回合。在 495 個 Banking77 樣本上的準確率為 92.93%。這些是訓練中已涉及之任務類別的保留子集,並非完整基準成績。 10 月 5 日檢查點 · 保留的分類評估子集 任務 | 答對 / 評估數量 | 準確率 | AG News | 465 / 500 | 93.00% | SST-5 | 299 / 500 | 59.80% | Emotion | 458 / 500 | 91.60% | Banking77 | 460 / 495 | 92.93% | BoolQ | 171 / 202 | 84.65% | MNLI | 436 / 500 | 87.20% | RACE | 287 / 500 | 57.40% | SciQ | 123 / 128 | 96.09% | 在 Intel Xeon Platinum 8558 CPU 上,使用四個運算執行緒時,Banking77 推論的中位延遲為 375.2 ms,p95 為 452.1 ms。包含載入、暖機與推論,程序記憶體峰值為 2.17 GiB。 目前的 CPU 測量結果 Intel Xeon Platinum 8558 · FP32 · 批次大小 1 一個運算執行緒 延遲 · 越低越快中位數/p95 - AG News 1209.7 / 1385.0 ms - SST-5 973.6 / 1160.3 ms - Emotion 956.9 / 1165.8 ms - Banking77 1101.7 / 1276.9 ms - BoolQ 1600.8 / 2710.6 ms 01,5003,000 ms 四個運算執行緒 延遲 · 越低越快中位數/p95 - AG News 389.5 / 480.4 ms - SST-5 320.6 / 404.2 ms - Emotion 318.8 / 391.0 ms - Banking77 375.2 / 452.1 ms - BoolQ 486.7 / 782.2 ms 01,5003,000 ms 每種執行緒設定在兩個新程序中,對 120 個輸入執行 480 次呼叫。計時包含斷詞與推論,不含載入與暖機。使用共用主機與評估執行環境,不使用跨請求快取。 完整評估尚未完成。BoolQ、RACE 與公開 JevBench 診斷的表現較上一檢查點下降;原生 Dino 在 0/16 次嘗試中達到 60 秒目標。目前 GPU 延遲尚未測量。[已發布的評估](https://huggingface.co/gai-labs/reflex-1/blob/84c2cd49d31f73544e1e17539092056e741e7f03/evaluation.json)記錄了檢查點、測試條件與尚未完成的項目。 ## 它是如何運作的 每個請求都提供候選答案。該模型在其代幣限制範圍內支援每個問題 1—255 個 選項,並且多個問題可以 共享一個壓縮狀態。支援應用程式可以提供自己的佇列; 代理可以提供其可用工具的描述。新的決策 型別需要自己的準確性測試。 模型對提供的選項進行評分;應用程式構造工具引數 並決定允許哪些操作。狀態文字的上限為 512 個 上下文令牌生成器令牌,並且可以透過請求預算進一步縮短。 每個選項最多可接受 512 個期權代幣生成器代幣。檢查state_truncated 何時可能縮短了上下文。 Reflex-1/決策模型 ### 從問題到選擇。 - 01 / 輸入 #### 定義決策。 您的應用程式提供了狀態、問題及其可以據以採取行動的選擇。這些選擇可能會隨著每個請求而改變:支援佇列、可用工具或允許的操作。 狀態 + 問題 客戶被收取了兩次費用。 哪個問題匹配? 重複收費丟失的卡未知費用現金提取 ↓ 背景 + 問題ModernBERT 每種選擇MiniLM ↓ 共享得分頭選擇機率 ↓ 應用程式許可權 → 論點 → 操作 說明性支援請求。應用程式定義候選集合。 - 02 / 編碼 #### 代表背景和候選人。 經過改編的ModernBERT編碼器可以讀取狀態和問題。凍結的 MiniLM 編碼器代表每個提供的選項。幾個問題可以共享一個擁擠的狀態。 狀態 + 問題 客戶被收取了兩次費用。 哪個問題匹配? 重複收費丟失的卡未知費用現金提取 ↓ 背景 + 問題ModernBERT 每種選擇MiniLM ↓ 共享得分頭選擇機率 ↓ 應用程式許可權 → 論點 → 操作 兩個編碼器為一個共享的計分頭供電。這是預覽架構的示意圖。 - 03 / 評分 #### 在一輪比賽中為所有提供的選項打分。 共享頭部將上下文和候選表示形式組合在一起,然後返回所提供選擇的機率分佈。新的決策型別仍然需要準確性和校準測試。 狀態 + 問題 客戶被收取了兩次費用。 哪個問題匹配? 重複收費丟失的卡未知費用現金提取 ↓ 背景 + 問題ModernBERT 每種選擇MiniLM ↓ 共享得分頭選擇機率 ↓ 應用程式許可權 → 論點 → 操作 每個提供的候選人一個分數,歸一化為機率分佈。 - 04 / 行動 #### 讓應用程式執行決定。 應用程式決定允許哪些操作,構造任何工具引數並執行所選操作。Reflex-1提供分數;周圍的系統擁有控制迴路。 狀態 + 問題 客戶被收取了兩次費用。 哪個問題匹配? 重複收費丟失的卡未知費用現金提取 ↓ 背景 + 問題ModernBERT 每種選擇MiniLM ↓ 共享得分頭選擇機率 ↓ 應用程式許可權 → 論點 → 操作 應用程式邊界很重要:對工具進行評分並不能執行該工具。 公共開發預覽版的架構。支援請求說明了輸入格式。 ## 示例 下方範例與決策品質比較使用 10 月 3 日的快照。速度與資源測量另行標註。每段錄影保留實際結局,包括失敗。 ### Chromium Dino 本錄屏使用 Chromium 原版 chrome://dino 遊戲。Reflex-1 接收當前可見障礙物的幾何資訊,選擇奔跑、跳躍或下蹲。原生鍵盤事件執行這些選擇,推理期間遊戲時鐘持續執行。影片以正常速度展示真實瀏覽器畫面。 Reflex-1 · 原版 Chromium43.6 秒 · 無聲影片 [觀看 Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-002-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 遊戲中使用引擎可見幾何資訊的結構化輸入。這是 2026 年 10 月 3 日開發快照。獨立賽道的完整錄屏在 42.309 秒發生碰撞時結束(得分 535),未完成 60 秒時限。推理期間瀏覽器持續執行。 正常速度的瀏覽器錄屏;推理期間遊戲時鐘持續執行。 該快照的兩次嘗試分別在 42.31 秒和 30.41 秒後發生碰撞,均未達到 60 秒上限。較長的一次先展示。兩次使用獨立隨機賽道,不能據此進行配對模型比較。下方保留完整的第二次嘗試。 觀看第二次 Dino 嘗試 Reflex-1 · 原版 Chromium31.8 秒 · 無聲影片 [觀看 Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-003-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 遊戲中使用引擎可見幾何資訊的結構化輸入。這是 2026 年 10 月 3 日開發快照。獨立賽道的完整錄屏在 30.410 秒發生碰撞時結束(得分 351),未完成 60 秒時限。推理期間瀏覽器持續執行。 正常速度的瀏覽器錄屏;推理期間遊戲時鐘持續執行。 ### ViZDoom 遊戲為原生 ViZDoom 的 Defend the Center 場景,難度為 5。Reflex-1 根據可見物件邊界、生命值與彈藥量選擇動作。這是結構化狀態控制器,並非從畫素推斷動作。下方保留最初預先指定的示例,僅展示 Reflex-1 視角。 Reflex-1 · 原生 ViZDoom36.5 秒 · 無聲影片 [觀看 Reflex-1 · ViZDoom (MP4)](https://www.goodailabs.com/media/reflex-1/preview/vizdoom-510001-clean.mp4). Reflex-1 · ViZDoom. Reflex-1 在原生 ViZDoom 1.3.1 的 Defend the Center 場景中執行,難度為 5。2026 年 10 月 3 日開發快照;預先指定的錄製種子為 510001。完整回合在規定 45 秒模擬時間中的 34.514 秒時死亡結束,擊殺 30 個敵人。模型接收引擎可見標籤與生命值/彈藥量,不接收畫素。播放遵循錄製的模擬時間,不包含推理延遲。 按模擬時間播放,不包含推理延遲;保留原始終止畫面的停留時間。 在全部 32 個預留回合中,該快照平均擊殺 18.88 個敵人,存活 22.47 秒。所有回合都在 45 秒上限前結束。圖表保留全部外部對比模型與完整回合計數。 ViZDoom · 擊殺數與生存限制 2026 年 10 月 3 日 · 開發快照 70a843878214 Defend the Center · 難度 5 擊殺數 · 越高越好均值 · 95% 區間 - Reflex-10/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 22.47 s 18.995% 置信區間 16.6–21.2 - Laya0/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 4.90 s 1.495% 置信區間 1.2–1.6 - OpenJev · DeBERTa0/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 4.90 s 1.495% 置信區間 1.2–1.6 - Kev-0.8B0/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 4.90 s 1.495% 置信區間 1.2–1.6 010203040 此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 原版 ViZDoom 引擎,結構化可見狀態輸入,直接執行 argmax 動作;每回合上限 45 秒。保留全部宣告結果。均值區間對配對種子重取樣 10,000 次。預留回合種子不能證明結構化狀態未被見過。這是指定介面卡/環境下的比較,並非官方基準得分或畫素輸入策略評估。 Reflex-1 平均擊殺 18.88 個敵人、存活 22.47 秒,完整時長完成數為 0/32。Laya、OpenJev 與 Kev 均平均擊殺 1.375 個,也均完成 0/32。參考模型按原發布版本使用,訓練經歷不同。 ### 瀏覽器工作流 這些是隨 Laya Browser 分發、在本地託管的合成 WebGym 站點。瀏覽器狀態在真實 Chromium 中捕獲,成功與否由原始任務檢查器判定。Reflex-1 選擇動作與目標,共用的 Qwen3-1.7B 輔助模型提供輸入文字和下拉框值。結果衡量的是這一完整系統。 Reflex-1 · 合成 WebGym30.1 秒 · 4× · 無聲影片 [觀看 餐廳預訂 · 任務完成 (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-restaurant-960000-clean.mp4). 餐廳預訂 · 任務完成. 10 月 3 日開發快照;15 個動作。在 Chromium 中捕獲瀏覽器狀態,以實際時間的 4× 速度回放,保留完整結局與終止畫面的停留。 本地合成任務,共用 Qwen3-1.7B 文字輔助模型。該快照與 Hub 預設權重不同。 Reflex-1 · 合成 WebGym8.1 秒 · 4× · 無聲影片 [觀看 購物任務 · 目標未完成 (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-shop-960000-clean.mp4). 購物任務 · 目標未完成. 10 月 3 日開發快照;4 個動作。在 Chromium 中捕獲瀏覽器狀態,以實際時間的 4× 速度回放,保留完整結局與終止畫面的停留。 本地合成任務,共用 Qwen3-1.7B 文字輔助模型。該快照與 Hub 預設權重不同。 餐廳任務成功,購物任務失敗。兩者使用同一預先指定的任務種子,保留錄製結局。影片按原始實際時間的 4× 速度回放瀏覽器狀態,並保留終止畫面的停留時間。這些是合成站點上的開發結果,不是 MiniWoB++、WebArena 或真實網站得分。 瀏覽器任務完成率 · 合成 WebGym 2026 年 10 月 3 日 · 開發快照 70a843878214 完成回合(%)· 越高越好記錄的價值 - Reflex-1485 次決策呼叫(0 次錯誤)· 102 次輔助模型呼叫(0 次 HTTP 錯誤 / 5 次介面約定錯誤) 13/35 - Laya Browser505 次決策呼叫(0 次錯誤)· 100 次輔助模型呼叫(0 次 HTTP 錯誤 / 7 次介面約定錯誤) 17/35 - Laya56 次決策呼叫(0 次錯誤)· 12 次輔助模型呼叫(0 次 HTTP 錯誤 / 0 次介面約定錯誤) 0/35 - OpenJev · DeBERTa35 次決策呼叫(24 次錯誤)· 0 次輔助模型呼叫(0 次 HTTP 錯誤 / 0 次介面約定錯誤) 0/35 - Kev-0.8B196 次決策呼叫(0 次錯誤)· 82 次輔助模型呼叫(0 次 HTTP 錯誤 / 0 次介面約定錯誤) 1/35 0255075100 此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 本地合成 WebGym 站點的真實 Chromium 錄屏。每個對照組使用相同執行器、Qwen3-1.7B 文字輔助模型與 40 步上限。Reflex-1 使用 BF16 autocast,狀態/請求詞元上限為 1,024 / 16,384;其他執行條件保留在下載中。保留各組全部 35 次嘗試、請求失敗與輔助模型錯誤。本圖與 MiniWoB++、WebArena 和真實網站評估分開。 源站點的最終狀態檢查記錄 Reflex-1 完成 13/35,Laya Browser 完成 17/35。專用模型仍然領先;圖中也展示另外三個外部對照組。 本研究中 Reflex-1 完成 13/35 項任務,Laya Browser 完成 17/35。分母保留所有嘗試、失敗與模型請求錯誤。之後在官方 MiniWoB++ 環境進行的小規模試驗中,該快照完成 0/30 項任務,因此不能把合成站點結果視為該基準上的成功。 ## 決策質量 Typed Decisions 涵蓋客戶支援、發票處理、安全告警和智慧體執行軌跡。評估保留原始狀態分組,透過統一選項介面要求各模型完成相同的五項判斷。Reflex-1 正確完成 1,508/2,000 項判斷(75.4%)。 結構化決策 2026 年 10 月 3 日 · 開發快照 70a843878214 客戶支援 精度 (%) · 越高越好準確率 · 95% 區間 - Reflex-1383/500 正確 · 0 次錯誤 · 0 次狀態截斷 76.6%95% 置信區間 72.0–80.8% - Laya · native210/500 正確 · 0 次錯誤 · 39 次狀態截斷 42.0%95% 置信區間 38.2–45.8% - OpenJev · DeBERTa206/500 正確 · 0 次錯誤 · 350 次狀態截斷 41.2%95% 置信區間 37.8–44.0% - Kev-0.8B314/500 正確 · 0 次錯誤 · 10 次狀態截斷 62.8%95% 置信區間 58.2–67.4% 0255075100 發票處理 精度 (%) · 越高越好準確率 · 95% 區間 - Reflex-1394/500 正確 · 0 次錯誤 · 0 次狀態截斷 78.8%95% 置信區間 75.0–82.4% - Laya · native192/500 正確 · 0 次錯誤 · 0 次狀態截斷 38.4%95% 置信區間 32.6–44.6% - OpenJev · DeBERTa203/500 正確 · 0 次錯誤 · 500 次狀態截斷 40.6%95% 置信區間 38.2–43.0% - Kev-0.8B252/500 正確 · 0 次錯誤 · 0 次狀態截斷 50.4%95% 置信區間 45.2–55.8% 0255075100 安全告警 精度 (%) · 越高越好準確率 · 95% 區間 - Reflex-1362/500 正確 · 0 次錯誤 · 0 次狀態截斷 72.4%95% 置信區間 68.4–76.2% - Laya · native167/500 正確 · 0 次錯誤 · 0 次狀態截斷 33.4%95% 置信區間 30.0–37.0% - OpenJev · DeBERTa210/500 正確 · 0 次錯誤 · 275 次狀態截斷 42.0%95% 置信區間 39.2–44.6% - Kev-0.8B236/500 正確 · 0 次錯誤 · 0 次狀態截斷 47.2%95% 置信區間 42.6–51.8% 0255075100 智慧體執行軌跡 精度 (%) · 越高越好準確率 · 95% 區間 - Reflex-1369/500 正確 · 0 次錯誤 · 0 次狀態截斷 73.8%95% 置信區間 69.0–78.4% - Laya · native193/500 正確 · 0 次錯誤 · 0 次狀態截斷 38.6%95% 置信區間 33.4–44.0% - OpenJev · DeBERTa192/500 正確 · 0 次錯誤 · 0 次狀態截斷 38.4%95% 置信區間 34.6–42.2% - Kev-0.8B179/500 正確 · 0 次錯誤 · 0 次狀態截斷 35.8%95% 置信區間 31.6–40.4% 0255075100 此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 400 個預留源狀態擴充套件為 2,000 項判斷,每個工作流含 500 項。區間透過重取樣源狀態得到,同時保留五個關聯輸出頭。 詞元上限:Reflex-1: 狀態 1,024, 請求 4,096; Laya · 原生: 請求 512, 指令/選項 192; OpenJev · DeBERTa: 狀態 256, 請求 512; Kev-0.8B: 狀態 512, 分支(包含狀態)2,048。 全評估群體的指令/選項縮短次數(不能把各任務圖表相加):Laya · 原生 0/2,000。這些計數與上方的狀態截斷次數分開。 透過統一選項介面,衡量與教師模型最常見選擇的一致率。這是適配後的資料集結果,並非官方多頭任務排行榜得分。 在預留的 CLINC 請求集中,Reflex-1 正確處理 3,680/4,490 個意圖與範圍外請求(82.0%)。陌生工具選擇為 72/87,低於外部模型的最佳結果 82/87。下方同時展示優勢與差距。 意圖路由 2026 年 10 月 3 日 · 開發快照 70a843878214 已知與陌生請求 精度 (%) · 越高越好準確率 · 95% 區間 - Reflex-13,680/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 64 次誤拒 · 370 次誤接受 82.0%95% 置信區間 80.8–83.1% - Laya · native1,425/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 0 次誤拒 · 942 次誤接受 31.7%95% 置信區間 30.3–33.2% - Laya · 擴充套件版1,017/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 0 次誤拒 · 942 次誤接受 22.7%95% 置信區間 21.4–23.9% - OpenJev · DeBERTa2,496/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 5 次誤拒 · 939 次誤接受 55.6%95% 置信區間 54.1–57.0% - Kev-0.8B2,298/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 1 次誤拒 · 937 次誤接受 51.2%95% 置信區間 49.6–52.6% 0255075100 此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 4,490 個預留請求:3,548 個已知意圖請求與 942 個範圍外請求。同時展示原生 Laya 與單獨宣告的擴充套件上下文對照。 詞元上限:Reflex-1: 狀態 1,024, 請求 4,096; Laya · 原生: 請求 512, 指令/選項 192; Laya · 擴充套件: 請求 2,048, 指令/選項 1,536; OpenJev · DeBERTa: 狀態 256, 請求 512; Kev-0.8B: 狀態 512, 分支(包含狀態)2,048。 全評估群體的指令/選項縮短次數(不能把各任務圖表相加):Laya · 原生 4,490/4,490;Laya · 擴充套件 0/4,490。這些計數與上方的狀態截斷次數分開。 Reflex-1 正確路由 3,108/3,548 個已知意圖請求,並拒絕 572/942 個範圍外請求。它誤拒 64 個已知請求,誤接受 370 個範圍外請求。保留全部外部模型條件。 陌生工具選擇 2026 年 10 月 3 日 · 開發快照 70a843878214 工具選擇 精度 (%) · 越高越好準確率 · 95% 區間 - Reflex-172/87 正確 · 0 次錯誤 · 0 次狀態截斷 82.8%95% 置信區間 74.7–90.8% - Laya · native80/87 正確 · 0 次錯誤 · 14 次狀態截斷 92.0%95% 置信區間 86.2–97.7% - Laya · 擴充套件版80/87 正確 · 0 次錯誤 · 0 次狀態截斷 92.0%95% 置信區間 86.2–97.7% - OpenJev · DeBERTa82/87 正確 · 0 次錯誤 · 30 次狀態截斷 94.3%95% 置信區間 88.5–98.9% - Kev-0.8B81/87 正確 · 0 次錯誤 · 1 次狀態截斷 93.1%95% 置信區間 87.4–97.7% 0255075100 此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 87 個預留請求,其工具名稱與規範化狀態在訓練前分離。這是工具選擇適配,不涉及引數生成或執行。 詞元上限:Reflex-1: 狀態 1,024, 請求 4,096; Laya · 原生: 請求 512, 指令/選項 192; Laya · 擴充套件: 請求 2,048, 指令/選項 1,536; OpenJev · DeBERTa: 狀態 256, 請求 512; Kev-0.8B: 狀態 512, 分支(包含狀態)2,048。 全評估群體的指令/選項縮短次數(不能把各任務圖表相加):Laya · 原生 87/87;Laya · 擴充套件 65/87。這些計數與上方的狀態截斷次數分開。 Reflex-1 正確選擇 72/87 個工具。Laya 在每個已宣告條件下均為 80/87,OpenJev 為 82/87,Kev 為 81/87。該測試僅評估給定工具中的選擇,不涵蓋引數生成或執行。 這些是使用已宣告評估群體的統一選項適配,並非官方排行榜提交。外部模型按原發布版本評估,未接受 Reflex-1 的任務專項訓練。圖表保留原始不確定性區間、詞元預算和截斷計數。 ## 速度與資源 本節測量對應 10 月 2 日的檢查點。目前檢查點的測量可在上方連結的模型卡中查看。 ### H200 請求延遲 我們在共享的 NVIDIA H200 上為每個型號重播了 120 個不同的請求。 它們來自五個遊戲和瀏覽器環境。每個模型都收到 相同的輸入,一次只能發出一個請求。 H200 請求延遲 120 次輸入·兩次重複·一個請求正在執行 毫秒·越低越快中位數/p95 - Reflex-1FP32 27.5 / 30.5 - OpenJevFP32 32.0 / 33.8 - Laya(原生)BF16 27.1 / 142.0 - Laya(FP32 重播)FP32 40.2 / 44.4 04080120160 點:中位數。行尾:p95。包括令牌化、評分和環回 HTTP;不包括載入和預熱。 120 個相同的輸入,每個輸入重播兩次,一個請求正在進行中。計時包括格式化、標記化、推理和環回 HTTP。跨度顯示的中位數為 p95。精度因標籤而異;FP32 Laya重播改變了兩個決定。 完整的測量表和協議 H200 · 相同的請求·延遲以毫秒為單位·越低越好 模型 | 計算資源 | 中位數 | p95 | reflex-1 | FP32 | 27.5 | 30.5 | OpenJev | FP32 | 32.0 | 33.8 | Laya(原生) | BF16 | 27.1 | 142.0 | Laya(FP32 重播) | FP32 | 40.2 | 44.4 | Laya原生使用BF16自動播放;還包括單獨的FP32重播。OpenJev 是 DeBerta 的公共檢查點,而不是託管的 Jev。這些請求時間不能衡量任務成功率或併發吞吐量。錄製於 2026-09-29。 reflex-1 的延遲中位數為 27.5 ms,p95 為 30.5 ms。它快於 FP32 下的 OpenJev,也快於另一次 FP32 回放中的 Laya。Laya 原生配置使用 BF16 autocast,中位數略低。由於使用共享機器且樣本有限,不能對接近的結果作過度推斷。 計時器包括標記化、模型評分、輸出標準化和環 回 HTTP。它不包括載入和三個預熱請求。答案和 選項快取已禁用。在這次執行中,我們沒有測量併發服務 吞吐量。這裡的 OpenJev 是 DeBerta 的公共檢查點; 它不是託管的 Jev 服務。 ### M4 CPU 延遲 CPU 測試使用了 MacBook Air M4、FP32 和批次大小 1。每個模型使用 一個 PyTorch 操作內執行緒、一個操作間執行緒和一個 BLAS 執行緒限制。 每項任務有 24 個不同的案例,每個案例重複 兩次。模型順序在八個執行塊中進行了平衡。 M4 CPU 請求延遲 FP32 · 第一批·PyTorch 執行緒 1/1 · BLAS 限制 1 Banking77 毫秒·對數刻度·越小越快中位數/p95 - Reflex-1 345.2 / 692.0 - OpenJev 1,332.6 / 2,857.1 - Laya 912.4 / 2,649.9 - Kev 4,283.4 / 11,073.7 1001k10k20k Emotion 毫秒·對數刻度·越小越快中位數/p95 - Reflex-1 256.2 / 610.4 - OpenJev 381.8 / 1,029.5 - Laya 240.1 / 427.7 - Kev 1,121.9 / 4,422.3 1001k10k20k AG News 毫秒·對數刻度·越小越快中位數/p95 - Reflex-1 321.7 / 578.7 - OpenJev 424.5 / 934.0 - Laya 324.1 / 760.5 - Kev 1,356.5 / 4,997.2 1001k10k20k SST-5 毫秒·對數刻度·越小越快中位數/p95 - Reflex-1 299.1 / 631.0 - OpenJev 360.5 / 894.5 - Laya 250.7 / 548.5 - Kev 902.2 / 4,480.5 1001k10k20k BoolQ 毫秒·對數刻度·越小越快中位數/p95 - Reflex-1 463.4 / 1,329.1 - OpenJev 451.9 / 1,398.9 - Laya 440.4 / 1,587.9 - Kev 1,775.3 / 6,548.0 1001k10k20k 點表示中位數,線段末端表示 p95。所有任務使用同一對數刻度。記憶體:單獨的 Reflex-1 回放測得峰值程序 RSS 為 1.50 GiB;本次比較未逐個測量各模型的記憶體。 FP32,批次大小為一;PyTorch 操作內/操作間執行緒數為 1/1,BLAS 執行緒數上限為 1。原始延遲測試中,每項任務有 24 個輸入,各重複兩次。單獨對 Reflex-1 進行的 240 次請求回放測得峰值程序 RSS 為 1.50 GiB,涵蓋載入、預熱和推理。原始比較未記錄各模型的記憶體。線段表示中位數至 p95 的範圍。Laya 會截斷 Banking77 的候選選項;Kev 使用未合併介面卡的參考 CPU 核心。 完整的測量表和協議 M4 CPU · FP32 · PyTorch 操作內/操作間隔 1/1 · BLAS 限制 1 · 中位數/p95 以毫秒為單位 任務 | reflex-1 | OpenJev | Laya | Kev | Banking77 | 345.2/ 692.0 | 1332.6/ 2857.1 | 912.4/ 2649.9 | 4283.4/ 11073.7 | Emotion | 256.2/ 610.4 | 381.8/ 1029.5 | 240.1/ 427.7 | 1121.9/ 4422.3 | AG News | 321.7/ 578.7 | 424.5/ 934.0 | 324.1/ 760.5 | 1356.5/ 4997.2 | SST-5 | 299.1/ 631.0 | 360.5/ 894.5 | 250.7/ 548.5 | 902.2/ 4480.5 | BoolQ | 463.4/ 1329.1 | 451.9/ 1398.9 | 440.4/ 1587.9 | 1775.3/ 6548.0 | 原生執行時預算。Laya按其原有預算截斷了Banking77的期權;擴大的預算結果將單獨報告。Kev 使用其 CPU 參考核心和未合併的介面卡。錄製於 2026-09-24。 Reflex-1 實測記憶體:1.50 GiB 峰值程序 RSS。對最初的120個輸入進行單獨的Reflex-1資源回放,每個輸入都得分兩次。全過程峰值 RSS 包括匯入、模型載入、預熱和推理。最初的四種模型延遲比較沒有記錄每個模型的記憶體。錄製於 2026-10-02 UTC。[資源測量和協議](https://huggingface.co/Goodailabs/reflex-1/resolve/main/assets/cpu-resources.json)。 Banking77 要求模型從 77 種意圖中選擇。reflex-1 的延遲中位數為 345.2 ms,同一次測試中 OpenJev 為 1,332.6 ms。五項任務中,reflex-1 的中位數在 256.2 至 463.4 ms 之間。 Laya 完成了幾項小選擇的任務,速度更快。其原生Banking77預算截斷了期權,因此其時機涵蓋了縮減的候選組合。 Kev 使用了帶有未合併介面卡的 CPU 參考核心。後臺 膝上型電腦活動導致尾部延遲擴大。 本測試在模型已載入的條件下,計時從構建請求到返回規範化輸出的全過程。CPU 和 GPU 測試使用不同的請求,不能根據這些時間直接計算 CPU 到 GPU 的加速比。 ### 熟悉任務的準確率 reflex-1在Banking77的得分為95.0%,在Emotion上得分為92.2%。它在兩個 檢查點的比較中均處於領先地位,在AG News和SST-5 上並列最佳分數,在BoolQ上的得分 略低於OpenJev。SST-5 決策準確性 每項任務 500 個示例·開發診斷 Banking77 精度 (%) · 越高越好記錄的價值 - Reflex-1 95.0% - OpenJev 90.6% - Laya · native 44.4% - Laya · 擴充套件版 55.4% - Kev 82.4% 050100 Emotion 精度 (%) · 越高越好記錄的價值 - Reflex-1 92.2% - OpenJev 53.0% - Laya · native 57.6% - Laya · 擴充套件版 57.6% - Kev 54.4% 050100 AG News 精度 (%) · 越高越好記錄的價值 - Reflex-1 91.2% - OpenJev 77.4% - Laya · native 91.2% - Laya · 擴充套件版 91.2% - Kev 87.2% 050100 SST-5 精度 (%) · 越高越好記錄的價值 - Reflex-1 59.8% - OpenJev 59.8% - Laya · native 51.0% - Laya · 擴充套件版 51.0% - Kev 55.2% 050100 BoolQ 精度 (%) · 越高越好記錄的價值 - Reflex-1 86.0% - OpenJev 86.8% - Laya · native 71.2% - Laya · 擴充套件版 71.2% - Kev 82.6% 050100 任務組已納入訓練,在開發過程中對這些子集進行了檢查。訓練資料接觸情況因模型而異。Laya的原生預算減少了Banking77的期權。 每個模型每項任務收到相同的 500 個示例。這些任務系列包含在Reflex訓練中,並在開發過程中對子集進行了檢查。訓練資料接觸情況因模型而異。擴張預算的 Laya 保留了所有 77 個 Banking77 標籤。 完整的測量表和協議 準確度 (%) · 每項任務 500 個示例·開發診斷 任務 | reflex-1 | Laya,本地人 | Laya,已擴充套件 | OpenJev | Kev | Banking77 | 95.0 | 44.4 | 55.4 | 90.6 | 82.4 | Emotion | 92.2 | 57.6 | 57.6 | 53.0 | 54.4 | AG News | 91.2 | 91.2 | 91.2 | 77.4 | 87.2 | SST-5 | 59.8 | 51.0 | 51.0 | 59.8 | 55.2 | BoolQ | 86.0 | 71.2 | 71.2 | 86.8 | 82.6 | Laya SDK 0.3.20 顯示的是原生代幣預算和擴充套件代幣預算。原生 Banking77 預算截斷了選項集;擴充套件後的預算保留了所有 77 個標籤。這些是開發診斷,不是獨立的轉移評估。 這些是每項任務的 500 個診斷示例。任務系列已包含 在訓練中,我們在開發過程中檢查了子集。不同模型的訓練 預算和先前的曝光量有所不同。在更多示例中,精度與延遲是 分開測量的。 通用檢查點使用我們的定製 瀏覽器控制器完成了 80 次試驗中的 0 次。結果暴露了熟悉任務 分類和自主控制之間的巨大差距。轉到不熟悉的問題 ,機率校準仍然是未解決的評估問題。 ### 訓練和儲存 合併介面卡後,服務模型有 420,778,370 個引數。 ModernBERT對狀態和問題進行編碼;凍結的 MiniLM 編碼器代表選擇。 共同的頭像組合了他們的表現形式。 reflex-1 · 服務規模和適應預算 資源 | 已錄製的配置 | 服務引數 | 420,778,370 | 在適應中訓練的引數 | 9,036,290 | 適配硬體 | 1 × NVIDIA H200 | 主跑 | 6,000 次更新·75 分 7 秒 | 在磁碟上提取的 FP32 模型 | ≈ 1.69 GB | 測得的 CPU 程序記憶體 | 1.50 GiB 峰值 RSS · 單獨回放 240 個請求 | CPU 計算執行緒 | PyTorch 操作內/互操作 1/1 · BLAS 限制 1 | 主要改編執行使用了來自八個任務系列的290,657條記錄,在6,000個步驟中更新了9,036,290個引數。 在一個 H200 上花了 75 分 7 秒,包括開發螢幕和檢查點儲存。基礎模型 預訓練、資料準備、投影擬合和早期實驗 是額外的成本。 解壓後的 FP32 模型在磁碟上約佔 1.69 GB。單獨的 CPU 資源回放測得峰值程序 RSS 為 1.50 GiB,涵蓋框架分配、分詞器、載入、預熱和推理。GPU 記憶體佔用尚未測量。 ## 模型訪問許可權 [Hugging Face 的公開](https://huggingface.co/gai-labs/reflex-1) 版本包含 1.68 GB 的 FP32 權重、兩個代幣生成器和 Apache 2.0 下的自成 一體 Transformers 實現。無需賬戶、API 金鑰或 GitHub 訪問許可權。使用 Python 3.12: ``` python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0" ``` ``` import torch from transformers import AutoModel torch.set_num_threads(1) model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True) decision = model.predict( state="The customer was charged twice for one card payment.", question="Choose the matching issue.", options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"], )[0] print(decision.choice) ``` 載入模型一次即可重複使用。模型卡記錄了批次推理、 多個問題、離線載入和釋出雜湊值。開發 倉庫保持私有狀態;公共包包含推理 所需的程式碼。 原始訓練使用了 RACE 和 SciQ,其來源條款包含非商業使用限制。[模型卡](https://huggingface.co/gai-labs/reflex-1)記錄了使用情況和固定版本。來源審查並未確定這些條款如何適用於訓練後的權重。 ## 錄屏與復現 使用 [Hub 上十月 3 日的固定版本](https://huggingface.co/gai-labs/reflex-1/tree/ae50bf81cddcaaac2aa18021d862433ca69da197)復現這些錄影。上方圖表保留了測得的結果,包括原有能力的退化。每段錄影均說明環境、輸入格式和播放速度。 目前版本的模型卡連結至獨立評估。這些錄影與研究保留其原始結果。 也在研究中 ## 也在研究中 - ### [Samsara-VLA](https://www.goodailabs.com/zh-tw/research/samsara-vla/) 兩個用於語言條件操作的精簡機器人策略。觀看它們抓取、放置、開啟並完成多步驟任務。 - ### [VIO-lens-2](https://www.goodailabs.com/zh-tw/research/vio-lens-2/) 研究進行中。 信函 ## 寫信給我們 如需評估、模型訪問或研究合作,請聯絡我們。 [research@goodailabs.com](mailto:research@goodailabs.com?subject=Reflex-1)