研究 公開權重
Reflex-1
面向智慧體的決策模型
面向智慧體的 421M 引數決策模型。在 CPU 或 GPU 上,一次前向傳播即可完成評分。
微調後的權重已在 Hugging Face 提供。
概覽
許多代理決策都以一個選擇告終:哪個佇列接收請求, 哪個工具適合任務,或者接下來要執行哪個操作。Reflex-1在一次正向傳遞 中對您的應用程式提供的選擇進行評分。它返回 機率分佈,應用程式可以使用該分佈來做出決定。
本研究沿著 Jev 探索的決策模型方向,採用不同的架構與監督訓練流程。28 層上下文編碼器和六層候選編碼器連接至共用評分頭。目前的檢查點更新了全部 420,778,370 個參數。
預設公開下載的是最新微調檢查點。其模型卡包含目前的評估結果與 CPU 測量。下方註明日期的研究與錄影保留其原始檢查點識別資訊。
決策模型
公開版本 · 執行環境 1.0.0- 使用
- 從應用程式提供的選項中進行選擇:標籤、路線或可能的操作。
- 輸入 → 輸出
- 狀態、問題和 1—255 個選項 → 一次正向傳遞中的選擇分佈。
- 模型
- 421M 參數。28 層上下文編碼器、6 層候選編碼器和共用評分頭。
- 在本地執行
- CPU 或 GPU · FP32。目前 CPU 重播在一個或四個運算執行緒下測得 2.17 GiB 的程序尖峰記憶體。
- 評估
- 在 495 筆 Banking77 保留樣本上達到 92.93%;原生 MiniWoB++ 完成 21/30 個回合。這些任務類型在訓練中有涵蓋。
- 獲取方式
- Apache 2.0 下的公共權重、分詞器和推理程式碼。英文文字;執行時間 1.0.0。
預設下載的是最新微調檢查點。下方註明日期的研究與錄影對應較早的檢查點。應用程式負責提供候選項並控制執行。
目前結果
10 月 5 日發布的模型使用固定控制器,完成了 21/30 個原生 MiniWoB++ 瀏覽器回合。在 495 個 Banking77 樣本上的準確率為 92.93%。這些是訓練中已涉及之任務類別的保留子集,並非完整基準成績。
| 任務 | 答對 / 評估數量 | 準確率 |
|---|---|---|
| AG News | 465 / 500 | 93.00% |
| SST-5 | 299 / 500 | 59.80% |
| Emotion | 458 / 500 | 91.60% |
| Banking77 | 460 / 495 | 92.93% |
| BoolQ | 171 / 202 | 84.65% |
| MNLI | 436 / 500 | 87.20% |
| RACE | 287 / 500 | 57.40% |
| SciQ | 123 / 128 | 96.09% |
在 Intel Xeon Platinum 8558 CPU 上,使用四個運算執行緒時,Banking77 推論的中位延遲為 375.2 ms,p95 為 452.1 ms。包含載入、暖機與推論,程序記憶體峰值為 2.17 GiB。
目前的 CPU 測量結果
Intel Xeon Platinum 8558 · FP32 · 批次大小 1一個運算執行緒
- AG News 1209.7 / 1385.0 ms
- SST-5 973.6 / 1160.3 ms
- Emotion 956.9 / 1165.8 ms
- Banking77 1101.7 / 1276.9 ms
- BoolQ 1600.8 / 2710.6 ms
四個運算執行緒
- AG News 389.5 / 480.4 ms
- SST-5 320.6 / 404.2 ms
- Emotion 318.8 / 391.0 ms
- Banking77 375.2 / 452.1 ms
- BoolQ 486.7 / 782.2 ms
每種執行緒設定在兩個新程序中,對 120 個輸入執行 480 次呼叫。計時包含斷詞與推論,不含載入與暖機。使用共用主機與評估執行環境,不使用跨請求快取。
完整評估尚未完成。BoolQ、RACE 與公開 JevBench 診斷的表現較上一檢查點下降;原生 Dino 在 0/16 次嘗試中達到 60 秒目標。目前 GPU 延遲尚未測量。已發布的評估記錄了檢查點、測試條件與尚未完成的項目。
它是如何運作的
每個請求都提供候選答案。該模型在其代幣限制範圍內支援每個問題 1—255 個 選項,並且多個問題可以 共享一個壓縮狀態。支援應用程式可以提供自己的佇列; 代理可以提供其可用工具的描述。新的決策 型別需要自己的準確性測試。
模型對提供的選項進行評分;應用程式構造工具引數
並決定允許哪些操作。狀態文字的上限為 512 個
上下文令牌生成器令牌,並且可以透過請求預算進一步縮短。
每個選項最多可接受 512 個期權代幣生成器代幣。檢查state_truncated
何時可能縮短了上下文。
Reflex-1/決策模型
從問題到選擇。
01 / 輸入
定義決策。
您的應用程式提供了狀態、問題及其可以據以採取行動的選擇。這些選擇可能會隨著每個請求而改變:支援佇列、可用工具或允許的操作。
狀態 + 問題
客戶被收取了兩次費用。
哪個問題匹配?背景 + 問題ModernBERT每種選擇MiniLM共享得分頭選擇機率應用程式許可權 → 論點 → 操作說明性支援請求。應用程式定義候選集合。 02 / 編碼
代表背景和候選人。
經過改編的ModernBERT編碼器可以讀取狀態和問題。凍結的 MiniLM 編碼器代表每個提供的選項。幾個問題可以共享一個擁擠的狀態。
狀態 + 問題
客戶被收取了兩次費用。
哪個問題匹配?背景 + 問題ModernBERT每種選擇MiniLM共享得分頭選擇機率應用程式許可權 → 論點 → 操作兩個編碼器為一個共享的計分頭供電。這是預覽架構的示意圖。 03 / 評分
在一輪比賽中為所有提供的選項打分。
共享頭部將上下文和候選表示形式組合在一起,然後返回所提供選擇的機率分佈。新的決策型別仍然需要準確性和校準測試。
狀態 + 問題
客戶被收取了兩次費用。
哪個問題匹配?背景 + 問題ModernBERT每種選擇MiniLM共享得分頭選擇機率應用程式許可權 → 論點 → 操作每個提供的候選人一個分數,歸一化為機率分佈。 04 / 行動
讓應用程式執行決定。
應用程式決定允許哪些操作,構造任何工具引數並執行所選操作。Reflex-1提供分數;周圍的系統擁有控制迴路。
狀態 + 問題
客戶被收取了兩次費用。
哪個問題匹配?背景 + 問題ModernBERT每種選擇MiniLM共享得分頭選擇機率應用程式許可權 → 論點 → 操作應用程式邊界很重要:對工具進行評分並不能執行該工具。
公共開發預覽版的架構。支援請求說明了輸入格式。
示例
下方範例與決策品質比較使用 10 月 3 日的快照。速度與資源測量另行標註。每段錄影保留實際結局,包括失敗。
Chromium Dino
本錄屏使用 Chromium 原版 chrome://dino 遊戲。Reflex-1 接收當前可見障礙物的幾何資訊,選擇奔跑、跳躍或下蹲。原生鍵盤事件執行這些選擇,推理期間遊戲時鐘持續執行。影片以正常速度展示真實瀏覽器畫面。
該快照的兩次嘗試分別在 42.31 秒和 30.41 秒後發生碰撞,均未達到 60 秒上限。較長的一次先展示。兩次使用獨立隨機賽道,不能據此進行配對模型比較。下方保留完整的第二次嘗試。
觀看第二次 Dino 嘗試
ViZDoom
遊戲為原生 ViZDoom 的 Defend the Center 場景,難度為 5。Reflex-1 根據可見物件邊界、生命值與彈藥量選擇動作。這是結構化狀態控制器,並非從畫素推斷動作。下方保留最初預先指定的示例,僅展示 Reflex-1 視角。
在全部 32 個預留回合中,該快照平均擊殺 18.88 個敵人,存活 22.47 秒。所有回合都在 45 秒上限前結束。圖表保留全部外部對比模型與完整回合計數。
ViZDoom · 擊殺數與生存限制
2026 年 10 月 3 日 · 開發快照 70a843878214Defend the Center · 難度 5
- Reflex-10/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 22.47 s 18.995% 置信區間 16.6–21.2
- Laya0/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 4.90 s 1.495% 置信區間 1.2–1.6
- OpenJev · DeBERTa0/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 4.90 s 1.495% 置信區間 1.2–1.6
- Kev-0.8B0/32 達到 45 s · 32 次死亡 · 0 次錯誤 · 平均存活 4.90 s 1.495% 置信區間 1.2–1.6
此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 原版 ViZDoom 引擎,結構化可見狀態輸入,直接執行 argmax 動作;每回合上限 45 秒。保留全部宣告結果。均值區間對配對種子重取樣 10,000 次。預留回合種子不能證明結構化狀態未被見過。這是指定介面卡/環境下的比較,並非官方基準得分或畫素輸入策略評估。
瀏覽器工作流
這些是隨 Laya Browser 分發、在本地託管的合成 WebGym 站點。瀏覽器狀態在真實 Chromium 中捕獲,成功與否由原始任務檢查器判定。Reflex-1 選擇動作與目標,共用的 Qwen3-1.7B 輔助模型提供輸入文字和下拉框值。結果衡量的是這一完整系統。
餐廳任務成功,購物任務失敗。兩者使用同一預先指定的任務種子,保留錄製結局。影片按原始實際時間的 4× 速度回放瀏覽器狀態,並保留終止畫面的停留時間。這些是合成站點上的開發結果,不是 MiniWoB++、WebArena 或真實網站得分。
瀏覽器任務完成率 · 合成 WebGym
2026 年 10 月 3 日 · 開發快照 70a843878214- Reflex-1485 次決策呼叫(0 次錯誤)· 102 次輔助模型呼叫(0 次 HTTP 錯誤 / 5 次介面約定錯誤) 13/35
- Laya Browser505 次決策呼叫(0 次錯誤)· 100 次輔助模型呼叫(0 次 HTTP 錯誤 / 7 次介面約定錯誤) 17/35
- Laya56 次決策呼叫(0 次錯誤)· 12 次輔助模型呼叫(0 次 HTTP 錯誤 / 0 次介面約定錯誤) 0/35
- OpenJev · DeBERTa35 次決策呼叫(24 次錯誤)· 0 次輔助模型呼叫(0 次 HTTP 錯誤 / 0 次介面約定錯誤) 0/35
- Kev-0.8B196 次決策呼叫(0 次錯誤)· 82 次輔助模型呼叫(0 次 HTTP 錯誤 / 0 次介面約定錯誤) 1/35
此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 本地合成 WebGym 站點的真實 Chromium 錄屏。每個對照組使用相同執行器、Qwen3-1.7B 文字輔助模型與 40 步上限。Reflex-1 使用 BF16 autocast,狀態/請求詞元上限為 1,024 / 16,384;其他執行條件保留在下載中。保留各組全部 35 次嘗試、請求失敗與輔助模型錯誤。本圖與 MiniWoB++、WebArena 和真實網站評估分開。
本研究中 Reflex-1 完成 13/35 項任務,Laya Browser 完成 17/35。分母保留所有嘗試、失敗與模型請求錯誤。之後在官方 MiniWoB++ 環境進行的小規模試驗中,該快照完成 0/30 項任務,因此不能把合成站點結果視為該基準上的成功。
決策質量
Typed Decisions 涵蓋客戶支援、發票處理、安全告警和智慧體執行軌跡。評估保留原始狀態分組,透過統一選項介面要求各模型完成相同的五項判斷。Reflex-1 正確完成 1,508/2,000 項判斷(75.4%)。
結構化決策
2026 年 10 月 3 日 · 開發快照 70a843878214客戶支援
- Reflex-1383/500 正確 · 0 次錯誤 · 0 次狀態截斷 76.6%95% 置信區間 72.0–80.8%
- Laya · native210/500 正確 · 0 次錯誤 · 39 次狀態截斷 42.0%95% 置信區間 38.2–45.8%
- OpenJev · DeBERTa206/500 正確 · 0 次錯誤 · 350 次狀態截斷 41.2%95% 置信區間 37.8–44.0%
- Kev-0.8B314/500 正確 · 0 次錯誤 · 10 次狀態截斷 62.8%95% 置信區間 58.2–67.4%
發票處理
- Reflex-1394/500 正確 · 0 次錯誤 · 0 次狀態截斷 78.8%95% 置信區間 75.0–82.4%
- Laya · native192/500 正確 · 0 次錯誤 · 0 次狀態截斷 38.4%95% 置信區間 32.6–44.6%
- OpenJev · DeBERTa203/500 正確 · 0 次錯誤 · 500 次狀態截斷 40.6%95% 置信區間 38.2–43.0%
- Kev-0.8B252/500 正確 · 0 次錯誤 · 0 次狀態截斷 50.4%95% 置信區間 45.2–55.8%
安全告警
- Reflex-1362/500 正確 · 0 次錯誤 · 0 次狀態截斷 72.4%95% 置信區間 68.4–76.2%
- Laya · native167/500 正確 · 0 次錯誤 · 0 次狀態截斷 33.4%95% 置信區間 30.0–37.0%
- OpenJev · DeBERTa210/500 正確 · 0 次錯誤 · 275 次狀態截斷 42.0%95% 置信區間 39.2–44.6%
- Kev-0.8B236/500 正確 · 0 次錯誤 · 0 次狀態截斷 47.2%95% 置信區間 42.6–51.8%
智慧體執行軌跡
- Reflex-1369/500 正確 · 0 次錯誤 · 0 次狀態截斷 73.8%95% 置信區間 69.0–78.4%
- Laya · native193/500 正確 · 0 次錯誤 · 0 次狀態截斷 38.6%95% 置信區間 33.4–44.0%
- OpenJev · DeBERTa192/500 正確 · 0 次錯誤 · 0 次狀態截斷 38.4%95% 置信區間 34.6–42.2%
- Kev-0.8B179/500 正確 · 0 次錯誤 · 0 次狀態截斷 35.8%95% 置信區間 31.6–40.4%
此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 400 個預留源狀態擴充套件為 2,000 項判斷,每個工作流含 500 項。區間透過重取樣源狀態得到,同時保留五個關聯輸出頭。 詞元上限:Reflex-1: 狀態 1,024, 請求 4,096; Laya · 原生: 請求 512, 指令/選項 192; OpenJev · DeBERTa: 狀態 256, 請求 512; Kev-0.8B: 狀態 512, 分支(包含狀態)2,048。 全評估群體的指令/選項縮短次數(不能把各任務圖表相加):Laya · 原生 0/2,000。這些計數與上方的狀態截斷次數分開。
在預留的 CLINC 請求集中,Reflex-1 正確處理 3,680/4,490 個意圖與範圍外請求(82.0%)。陌生工具選擇為 72/87,低於外部模型的最佳結果 82/87。下方同時展示優勢與差距。
意圖路由
2026 年 10 月 3 日 · 開發快照 70a843878214已知與陌生請求
- Reflex-13,680/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 64 次誤拒 · 370 次誤接受 82.0%95% 置信區間 80.8–83.1%
- Laya · native1,425/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 0 次誤拒 · 942 次誤接受 31.7%95% 置信區間 30.3–33.2%
- Laya · 擴充套件版1,017/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 0 次誤拒 · 942 次誤接受 22.7%95% 置信區間 21.4–23.9%
- OpenJev · DeBERTa2,496/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 5 次誤拒 · 939 次誤接受 55.6%95% 置信區間 54.1–57.0%
- Kev-0.8B2,298/4,490 正確 · 0 次錯誤 · 0 次狀態截斷 · 1 次誤拒 · 937 次誤接受 51.2%95% 置信區間 49.6–52.6%
此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 4,490 個預留請求:3,548 個已知意圖請求與 942 個範圍外請求。同時展示原生 Laya 與單獨宣告的擴充套件上下文對照。 詞元上限:Reflex-1: 狀態 1,024, 請求 4,096; Laya · 原生: 請求 512, 指令/選項 192; Laya · 擴充套件: 請求 2,048, 指令/選項 1,536; OpenJev · DeBERTa: 狀態 256, 請求 512; Kev-0.8B: 狀態 512, 分支(包含狀態)2,048。 全評估群體的指令/選項縮短次數(不能把各任務圖表相加):Laya · 原生 4,490/4,490;Laya · 擴充套件 0/4,490。這些計數與上方的狀態截斷次數分開。
陌生工具選擇
2026 年 10 月 3 日 · 開發快照 70a843878214工具選擇
- Reflex-172/87 正確 · 0 次錯誤 · 0 次狀態截斷 82.8%95% 置信區間 74.7–90.8%
- Laya · native80/87 正確 · 0 次錯誤 · 14 次狀態截斷 92.0%95% 置信區間 86.2–97.7%
- Laya · 擴充套件版80/87 正確 · 0 次錯誤 · 0 次狀態截斷 92.0%95% 置信區間 86.2–97.7%
- OpenJev · DeBERTa82/87 正確 · 0 次錯誤 · 30 次狀態截斷 94.3%95% 置信區間 88.5–98.9%
- Kev-0.8B81/87 正確 · 0 次錯誤 · 1 次狀態截斷 93.1%95% 置信區間 87.4–97.7%
此處 Reflex-1 指所展示的 10 月 3 日開發權重,並非預設下載或最終版本。 87 個預留請求,其工具名稱與規範化狀態在訓練前分離。這是工具選擇適配,不涉及引數生成或執行。 詞元上限:Reflex-1: 狀態 1,024, 請求 4,096; Laya · 原生: 請求 512, 指令/選項 192; Laya · 擴充套件: 請求 2,048, 指令/選項 1,536; OpenJev · DeBERTa: 狀態 256, 請求 512; Kev-0.8B: 狀態 512, 分支(包含狀態)2,048。 全評估群體的指令/選項縮短次數(不能把各任務圖表相加):Laya · 原生 87/87;Laya · 擴充套件 65/87。這些計數與上方的狀態截斷次數分開。
這些是使用已宣告評估群體的統一選項適配,並非官方排行榜提交。外部模型按原發布版本評估,未接受 Reflex-1 的任務專項訓練。圖表保留原始不確定性區間、詞元預算和截斷計數。
速度與資源
本節測量對應 10 月 2 日的檢查點。目前檢查點的測量可在上方連結的模型卡中查看。
H200 請求延遲
我們在共享的 NVIDIA H200 上為每個型號重播了 120 個不同的請求。 它們來自五個遊戲和瀏覽器環境。每個模型都收到 相同的輸入,一次只能發出一個請求。
H200 請求延遲
120 次輸入·兩次重複·一個請求正在執行- Reflex-1FP32 27.5 / 30.5
- OpenJevFP32 32.0 / 33.8
- Laya(原生)BF16 27.1 / 142.0
- Laya(FP32 重播)FP32 40.2 / 44.4
點:中位數。行尾:p95。包括令牌化、評分和環回 HTTP;不包括載入和預熱。
完整的測量表和協議
| 模型 | 計算資源 | 中位數 | p95 |
|---|---|---|---|
| reflex-1 | FP32 | 27.5 | 30.5 |
| OpenJev | FP32 | 32.0 | 33.8 |
| Laya(原生) | BF16 | 27.1 | 142.0 |
| Laya(FP32 重播) | FP32 | 40.2 | 44.4 |
Laya原生使用BF16自動播放;還包括單獨的FP32重播。OpenJev 是 DeBerta 的公共檢查點,而不是託管的 Jev。這些請求時間不能衡量任務成功率或併發吞吐量。錄製於 2026-09-29。
reflex-1 的延遲中位數為 27.5 ms,p95 為 30.5 ms。它快於 FP32 下的 OpenJev,也快於另一次 FP32 回放中的 Laya。Laya 原生配置使用 BF16 autocast,中位數略低。由於使用共享機器且樣本有限,不能對接近的結果作過度推斷。
計時器包括標記化、模型評分、輸出標準化和環 回 HTTP。它不包括載入和三個預熱請求。答案和 選項快取已禁用。在這次執行中,我們沒有測量併發服務 吞吐量。這裡的 OpenJev 是 DeBerta 的公共檢查點; 它不是託管的 Jev 服務。
M4 CPU 延遲
CPU 測試使用了 MacBook Air M4、FP32 和批次大小 1。每個模型使用 一個 PyTorch 操作內執行緒、一個操作間執行緒和一個 BLAS 執行緒限制。 每項任務有 24 個不同的案例,每個案例重複 兩次。模型順序在八個執行塊中進行了平衡。
M4 CPU 請求延遲
FP32 · 第一批·PyTorch 執行緒 1/1 · BLAS 限制 1Banking77
- Reflex-1 345.2 / 692.0
- OpenJev 1,332.6 / 2,857.1
- Laya 912.4 / 2,649.9
- Kev 4,283.4 / 11,073.7
Emotion
- Reflex-1 256.2 / 610.4
- OpenJev 381.8 / 1,029.5
- Laya 240.1 / 427.7
- Kev 1,121.9 / 4,422.3
AG News
- Reflex-1 321.7 / 578.7
- OpenJev 424.5 / 934.0
- Laya 324.1 / 760.5
- Kev 1,356.5 / 4,997.2
SST-5
- Reflex-1 299.1 / 631.0
- OpenJev 360.5 / 894.5
- Laya 250.7 / 548.5
- Kev 902.2 / 4,480.5
BoolQ
- Reflex-1 463.4 / 1,329.1
- OpenJev 451.9 / 1,398.9
- Laya 440.4 / 1,587.9
- Kev 1,775.3 / 6,548.0
點表示中位數,線段末端表示 p95。所有任務使用同一對數刻度。記憶體:單獨的 Reflex-1 回放測得峰值程序 RSS 為 1.50 GiB;本次比較未逐個測量各模型的記憶體。
完整的測量表和協議
| 任務 | reflex-1 | OpenJev | Laya | Kev |
|---|---|---|---|---|
| Banking77 | 345.2/ 692.0 | 1332.6/ 2857.1 | 912.4/ 2649.9 | 4283.4/ 11073.7 |
| Emotion | 256.2/ 610.4 | 381.8/ 1029.5 | 240.1/ 427.7 | 1121.9/ 4422.3 |
| AG News | 321.7/ 578.7 | 424.5/ 934.0 | 324.1/ 760.5 | 1356.5/ 4997.2 |
| SST-5 | 299.1/ 631.0 | 360.5/ 894.5 | 250.7/ 548.5 | 902.2/ 4480.5 |
| BoolQ | 463.4/ 1329.1 | 451.9/ 1398.9 | 440.4/ 1587.9 | 1775.3/ 6548.0 |
原生執行時預算。Laya按其原有預算截斷了Banking77的期權;擴大的預算結果將單獨報告。Kev 使用其 CPU 參考核心和未合併的介面卡。錄製於 2026-09-24。
Reflex-1 實測記憶體:1.50 GiB 峰值程序 RSS。對最初的120個輸入進行單獨的Reflex-1資源回放,每個輸入都得分兩次。全過程峰值 RSS 包括匯入、模型載入、預熱和推理。最初的四種模型延遲比較沒有記錄每個模型的記憶體。錄製於 2026-10-02 UTC。資源測量和協議。
Banking77 要求模型從 77 種意圖中選擇。reflex-1 的延遲中位數為 345.2 ms,同一次測試中 OpenJev 為 1,332.6 ms。五項任務中,reflex-1 的中位數在 256.2 至 463.4 ms 之間。
Laya 完成了幾項小選擇的任務,速度更快。其原生Banking77預算截斷了期權,因此其時機涵蓋了縮減的候選組合。 Kev 使用了帶有未合併介面卡的 CPU 參考核心。後臺 膝上型電腦活動導致尾部延遲擴大。
本測試在模型已載入的條件下,計時從構建請求到返回規範化輸出的全過程。CPU 和 GPU 測試使用不同的請求,不能根據這些時間直接計算 CPU 到 GPU 的加速比。
熟悉任務的準確率
reflex-1在Banking77的得分為95.0%,在Emotion上得分為92.2%。它在兩個 檢查點的比較中均處於領先地位,在AG News和SST-5 上並列最佳分數,在BoolQ上的得分 略低於OpenJev。SST-5
決策準確性
每項任務 500 個示例·開發診斷Banking77
- Reflex-1 95.0%
- OpenJev 90.6%
- Laya · native 44.4%
- Laya · 擴充套件版 55.4%
- Kev 82.4%
Emotion
- Reflex-1 92.2%
- OpenJev 53.0%
- Laya · native 57.6%
- Laya · 擴充套件版 57.6%
- Kev 54.4%
AG News
- Reflex-1 91.2%
- OpenJev 77.4%
- Laya · native 91.2%
- Laya · 擴充套件版 91.2%
- Kev 87.2%
SST-5
- Reflex-1 59.8%
- OpenJev 59.8%
- Laya · native 51.0%
- Laya · 擴充套件版 51.0%
- Kev 55.2%
BoolQ
- Reflex-1 86.0%
- OpenJev 86.8%
- Laya · native 71.2%
- Laya · 擴充套件版 71.2%
- Kev 82.6%
任務組已納入訓練,在開發過程中對這些子集進行了檢查。訓練資料接觸情況因模型而異。Laya的原生預算減少了Banking77的期權。
完整的測量表和協議
| 任務 | reflex-1 | Laya,本地人 | Laya,已擴充套件 | OpenJev | Kev |
|---|---|---|---|---|---|
| Banking77 | 95.0 | 44.4 | 55.4 | 90.6 | 82.4 |
| Emotion | 92.2 | 57.6 | 57.6 | 53.0 | 54.4 |
| AG News | 91.2 | 91.2 | 91.2 | 77.4 | 87.2 |
| SST-5 | 59.8 | 51.0 | 51.0 | 59.8 | 55.2 |
| BoolQ | 86.0 | 71.2 | 71.2 | 86.8 | 82.6 |
Laya SDK 0.3.20 顯示的是原生代幣預算和擴充套件代幣預算。原生 Banking77 預算截斷了選項集;擴充套件後的預算保留了所有 77 個標籤。這些是開發診斷,不是獨立的轉移評估。
這些是每項任務的 500 個診斷示例。任務系列已包含 在訓練中,我們在開發過程中檢查了子集。不同模型的訓練 預算和先前的曝光量有所不同。在更多示例中,精度與延遲是 分開測量的。
通用檢查點使用我們的定製 瀏覽器控制器完成了 80 次試驗中的 0 次。結果暴露了熟悉任務 分類和自主控制之間的巨大差距。轉到不熟悉的問題 ,機率校準仍然是未解決的評估問題。
訓練和儲存
合併介面卡後,服務模型有 420,778,370 個引數。 ModernBERT對狀態和問題進行編碼;凍結的 MiniLM 編碼器代表選擇。 共同的頭像組合了他們的表現形式。
| 資源 | 已錄製的配置 |
|---|---|
| 服務引數 | 420,778,370 |
| 在適應中訓練的引數 | 9,036,290 |
| 適配硬體 | 1 × NVIDIA H200 |
| 主跑 | 6,000 次更新·75 分 7 秒 |
| 在磁碟上提取的 FP32 模型 | ≈ 1.69 GB |
| 測得的 CPU 程序記憶體 | 1.50 GiB 峰值 RSS · 單獨回放 240 個請求 |
| CPU 計算執行緒 | PyTorch 操作內/互操作 1/1 · BLAS 限制 1 |
主要改編執行使用了來自八個任務系列的290,657條記錄,在6,000個步驟中更新了9,036,290個引數。 在一個 H200 上花了 75 分 7 秒,包括開發螢幕和檢查點儲存。基礎模型 預訓練、資料準備、投影擬合和早期實驗 是額外的成本。
解壓後的 FP32 模型在磁碟上約佔 1.69 GB。單獨的 CPU 資源回放測得峰值程序 RSS 為 1.50 GiB,涵蓋框架分配、分詞器、載入、預熱和推理。GPU 記憶體佔用尚未測量。
模型訪問許可權
Hugging Face 的公開 版本包含 1.68 GB 的 FP32 權重、兩個代幣生成器和 Apache 2.0 下的自成 一體 Transformers 實現。無需賬戶、API 金鑰或 GitHub 訪問許可權。使用 Python 3.12:
python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0"
import torch
from transformers import AutoModel
torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)
decision = model.predict(
state="The customer was charged twice for one card payment.",
question="Choose the matching issue.",
options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)
載入模型一次即可重複使用。模型卡記錄了批次推理、 多個問題、離線載入和釋出雜湊值。開發 倉庫保持私有狀態;公共包包含推理 所需的程式碼。
原始訓練使用了 RACE 和 SciQ,其來源條款包含非商業使用限制。模型卡記錄了使用情況和固定版本。來源審查並未確定這些條款如何適用於訓練後的權重。
錄屏與復現
使用 Hub 上十月 3 日的固定版本復現這些錄影。上方圖表保留了測得的結果,包括原有能力的退化。每段錄影均說明環境、輸入格式和播放速度。
目前版本的模型卡連結至獨立評估。這些錄影與研究保留其原始結果。
也在研究中
Samsara-VLA
兩個用於語言條件操作的精簡機器人策略。觀看它們抓取、放置、開啟並完成多步驟任務。
VIO-lens-2
研究進行中。