[研究](https://www.goodailabs.com/zh-cn/research/) 公开权重 # Reflex-1 面向智能体的决策模型 面向智能体的 421M 参数决策模型。在 CPU 或 GPU 上,一次前向传播即可完成评分。 微调后的权重已在 Hugging Face 提供。 [Hugging Face 上的模型和权重 ↗](https://huggingface.co/gai-labs/reflex-1) [探索模型 ↓](https://www.goodailabs.com/#project-details) [阅读公告 ↗](https://www.goodailabs.com/zh-cn/blog/reflex-1-fast-decisions/) ## 概览 许多代理决策都以一个选择告终:哪个队列接收请求, 哪个工具适合任务,或者接下来要执行哪个操作。Reflex-1在一次正向传递 中对您的应用程序提供的选择进行评分。它返回 概率分布,应用程序可以使用该分布来做出决定。 本研究沿着 [Jev](https://docs.typesafe.ai/introduction) 探索的决策模型方向,采用不同的架构和监督训练流程。28 层上下文编码器和六层候选编码器连接到共享评分头。当前检查点更新了全部 420,778,370 个参数。 默认公开下载的是最新微调检查点。其模型卡包含当前评估结果和 CPU 测量。下方注明日期的研究和录像保留其原始检查点标识。 决策模型 公开版本 · 运行时 1.0.0 使用 从应用程序提供的选项中进行选择:标签、路线或可能的操作。 输入 → 输出 状态、问题和 1—255 个选项 → 一次正向传递中的选择分布。 模型 421M 参数。28 层上下文编码器、6 层候选编码器和共享评分头。 在本地运行 CPU 或 GPU · FP32。当前 CPU 回放在一个或四个计算线程下测得 2.17 GiB 的进程峰值内存。 评估 在 495 条 Banking77 保留样本上达到 92.93%;原生 MiniWoB++ 完成 21/30 个回合。这些任务类型在训练中有覆盖。 获取方式 Apache 2.0 下的公共权重、分词器和推理代码。英文文本;运行时间 1.0.0。 默认下载的是最新微调检查点。下方注明日期的研究和录像对应更早的检查点。应用负责提供候选项并控制执行。 [权重和推理 ↗](https://huggingface.co/gai-labs/reflex-1)[发布结果 ↗](https://www.goodailabs.com/zh-cn/research/reflex-1/#current-results) ## 当前结果 10 月 5 日发布的模型使用固定控制器,完成了 21/30 个原生 MiniWoB++ 浏览器回合。在 495 个 Banking77 样本上的准确率为 92.93%。这些是训练中已涉及的任务类别的预留子集,并非完整基准成绩。 10 月 5 日检查点 · 预留分类评估子集 任务 | 正确 / 评估数量 | 准确率 | AG News | 465 / 500 | 93.00% | SST-5 | 299 / 500 | 59.80% | Emotion | 458 / 500 | 91.60% | Banking77 | 460 / 495 | 92.93% | BoolQ | 171 / 202 | 84.65% | MNLI | 436 / 500 | 87.20% | RACE | 287 / 500 | 57.40% | SciQ | 123 / 128 | 96.09% | 在 Intel Xeon Platinum 8558 CPU 上,使用四个计算线程时,Banking77 推理的中位延迟为 375.2 ms,p95 为 452.1 ms。包括加载、预热和推理在内,峰值进程内存为 2.17 GiB。 当前 CPU 测量结果 Intel Xeon Platinum 8558 · FP32 · 批大小 1 一个计算线程 延迟 · 越低越快中位数/p95 - AG News 1209.7 / 1385.0 ms - SST-5 973.6 / 1160.3 ms - Emotion 956.9 / 1165.8 ms - Banking77 1101.7 / 1276.9 ms - BoolQ 1600.8 / 2710.6 ms 01,5003,000 ms 四个计算线程 延迟 · 越低越快中位数/p95 - AG News 389.5 / 480.4 ms - SST-5 320.6 / 404.2 ms - Emotion 318.8 / 391.0 ms - Banking77 375.2 / 452.1 ms - BoolQ 486.7 / 782.2 ms 01,5003,000 ms 每种线程配置在两个新进程中对 120 个输入执行 480 次调用。计时包括分词和推理,不包括加载和预热。使用共享主机和评估运行时,不使用跨请求缓存。 完整评估尚未完成。BoolQ、RACE 和公开 JevBench 诊断的表现较上一检查点下降;原生 Dino 在 0/16 次尝试中达到 60 秒目标。当前 GPU 延迟尚未测量。[已发布的评估](https://huggingface.co/gai-labs/reflex-1/blob/84c2cd49d31f73544e1e17539092056e741e7f03/evaluation.json)记录了检查点、测试条件和剩余缺口。 ## 它是如何运作的 每个请求都提供候选答案。该模型在其代币限制范围内支持每个问题 1—255 个 选项,并且多个问题可以 共享一个压缩状态。支持应用程序可以提供自己的队列; 代理可以提供其可用工具的描述。新的决策 类型需要自己的准确性测试。 模型对提供的选项进行评分;应用程序构造工具参数 并决定允许哪些操作。状态文本的上限为 512 个 上下文令牌生成器令牌,并且可以通过请求预算进一步缩短。 每个选项最多可接受 512 个期权代币生成器代币。检查state_truncated 何时可能缩短了上下文。 Reflex-1/决策模型 ### 从问题到选择。 - 01 / 输入 #### 定义决策。 您的应用程序提供了状态、问题及其可以据以采取行动的选择。这些选择可能会随着每个请求而改变:支持队列、可用工具或允许的操作。 状态 + 问题 客户被收取了两次费用。 哪个问题匹配? 重复收费丢失的卡未知费用现金提取 ↓ 背景 + 问题ModernBERT 每种选择MiniLM ↓ 共享得分头选择概率 ↓ 应用程序权限 → 论点 → 操作 说明性支持请求。应用程序定义候选集合。 - 02 / 编码 #### 代表背景和候选人。 经过改编的ModernBERT编码器可以读取状态和问题。冻结的 MiniLM 编码器代表每个提供的选项。几个问题可以共享一个拥挤的状态。 状态 + 问题 客户被收取了两次费用。 哪个问题匹配? 重复收费丢失的卡未知费用现金提取 ↓ 背景 + 问题ModernBERT 每种选择MiniLM ↓ 共享得分头选择概率 ↓ 应用程序权限 → 论点 → 操作 两个编码器为一个共享的计分头供电。这是预览架构的示意图。 - 03 / 评分 #### 在一轮比赛中为所有提供的选项打分。 共享头部将上下文和候选表示形式组合在一起,然后返回所提供选择的概率分布。新的决策类型仍然需要准确性和校准测试。 状态 + 问题 客户被收取了两次费用。 哪个问题匹配? 重复收费丢失的卡未知费用现金提取 ↓ 背景 + 问题ModernBERT 每种选择MiniLM ↓ 共享得分头选择概率 ↓ 应用程序权限 → 论点 → 操作 每个提供的候选人一个分数,归一化为概率分布。 - 04 / 行动 #### 让应用程序执行决定。 应用程序决定允许哪些操作,构造任何工具参数并执行所选操作。Reflex-1提供分数;周围的系统拥有控制回路。 状态 + 问题 客户被收取了两次费用。 哪个问题匹配? 重复收费丢失的卡未知费用现金提取 ↓ 背景 + 问题ModernBERT 每种选择MiniLM ↓ 共享得分头选择概率 ↓ 应用程序权限 → 论点 → 操作 应用程序边界很重要:对工具进行评分并不能执行该工具。 公共开发预览版的架构。支持请求说明了输入格式。 ## 示例 下方示例和决策质量对比使用 10 月 3 日的快照。速度与资源测量另行标注。每段录像保留实际结局,包括失败。 ### Chromium Dino 本录屏使用 Chromium 原版 chrome://dino 游戏。Reflex-1 接收当前可见障碍物的几何信息,选择奔跑、跳跃或下蹲。原生键盘事件执行这些选择,推理期间游戏时钟持续运行。视频以正常速度展示真实浏览器画面。 Reflex-1 · 原版 Chromium43.6 秒 · 无声视频 [观看 Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-002-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 游戏中使用引擎可见几何信息的结构化输入。这是 2026 年 10 月 3 日开发快照。独立赛道的完整录屏在 42.309 秒发生碰撞时结束(得分 535),未完成 60 秒时限。推理期间浏览器持续运行。 正常速度的浏览器录屏;推理期间游戏时钟持续运行。 该快照的两次尝试分别在 42.31 秒和 30.41 秒后发生碰撞,均未达到 60 秒上限。较长的一次先展示。两次使用独立随机赛道,不能据此进行配对模型比较。下方保留完整的第二次尝试。 观看第二次 Dino 尝试 Reflex-1 · 原版 Chromium31.8 秒 · 无声视频 [观看 Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-003-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 游戏中使用引擎可见几何信息的结构化输入。这是 2026 年 10 月 3 日开发快照。独立赛道的完整录屏在 30.410 秒发生碰撞时结束(得分 351),未完成 60 秒时限。推理期间浏览器持续运行。 正常速度的浏览器录屏;推理期间游戏时钟持续运行。 ### ViZDoom 游戏为原生 ViZDoom 的 Defend the Center 场景,难度为 5。Reflex-1 根据可见对象边界、生命值与弹药量选择动作。这是结构化状态控制器,并非从像素推断动作。下方保留最初预先指定的示例,仅展示 Reflex-1 视角。 Reflex-1 · 原生 ViZDoom36.5 秒 · 无声视频 [观看 Reflex-1 · ViZDoom (MP4)](https://www.goodailabs.com/media/reflex-1/preview/vizdoom-510001-clean.mp4). Reflex-1 · ViZDoom. Reflex-1 在原生 ViZDoom 1.3.1 的 Defend the Center 场景中运行,难度为 5。2026 年 10 月 3 日开发快照;预先指定的录制种子为 510001。完整回合在规定 45 秒模拟时间中的 34.514 秒时死亡结束,击杀 30 个敌人。模型接收引擎可见标签与生命值/弹药量,不接收像素。播放遵循录制的模拟时间,不包含推理延迟。 按模拟时间播放,不包含推理延迟;保留原始终止画面的停留时间。 在全部 32 个预留回合中,该快照平均击杀 18.88 个敌人,存活 22.47 秒。所有回合都在 45 秒上限前结束。图表保留全部外部对比模型与完整回合计数。 ViZDoom · 击杀数与生存限制 2026 年 10 月 3 日 · 开发快照 70a843878214 Defend the Center · 难度 5 击杀数 · 越高越好均值 · 95% 区间 - Reflex-10/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 22.47 s 18.995% 置信区间 16.6–21.2 - Laya0/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 4.90 s 1.495% 置信区间 1.2–1.6 - OpenJev · DeBERTa0/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 4.90 s 1.495% 置信区间 1.2–1.6 - Kev-0.8B0/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 4.90 s 1.495% 置信区间 1.2–1.6 010203040 此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 原版 ViZDoom 引擎,结构化可见状态输入,直接执行 argmax 动作;每回合上限 45 秒。保留全部声明结果。均值区间对配对种子重采样 10,000 次。预留回合种子不能证明结构化状态未被见过。这是指定适配器/环境下的比较,并非官方基准得分或像素输入策略评估。 Reflex-1 平均击杀 18.88 个敌人、存活 22.47 秒,完整时长完成数为 0/32。Laya、OpenJev 与 Kev 均平均击杀 1.375 个,也均完成 0/32。参考模型按原发布版本使用,训练经历不同。 ### 浏览器工作流 这些是随 Laya Browser 分发、在本地托管的合成 WebGym 站点。浏览器状态在真实 Chromium 中捕获,成功与否由原始任务检查器判定。Reflex-1 选择动作与目标,共用的 Qwen3-1.7B 辅助模型提供输入文本和下拉框值。结果衡量的是这一完整系统。 Reflex-1 · 合成 WebGym30.1 秒 · 4× · 无声视频 [观看 餐厅预订 · 任务完成 (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-restaurant-960000-clean.mp4). 餐厅预订 · 任务完成. 10 月 3 日开发快照;15 个动作。在 Chromium 中捕获浏览器状态,以实际时间的 4× 速度回放,保留完整结局与终止画面的停留。 本地合成任务,共用 Qwen3-1.7B 文本辅助模型。该快照与 Hub 默认权重不同。 Reflex-1 · 合成 WebGym8.1 秒 · 4× · 无声视频 [观看 购物任务 · 目标未完成 (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-shop-960000-clean.mp4). 购物任务 · 目标未完成. 10 月 3 日开发快照;4 个动作。在 Chromium 中捕获浏览器状态,以实际时间的 4× 速度回放,保留完整结局与终止画面的停留。 本地合成任务,共用 Qwen3-1.7B 文本辅助模型。该快照与 Hub 默认权重不同。 餐厅任务成功,购物任务失败。两者使用同一预先指定的任务种子,保留录制结局。视频按原始实际时间的 4× 速度回放浏览器状态,并保留终止画面的停留时间。这些是合成站点上的开发结果,不是 MiniWoB++、WebArena 或真实网站得分。 浏览器任务完成率 · 合成 WebGym 2026 年 10 月 3 日 · 开发快照 70a843878214 完成回合(%)· 越高越好记录的价值 - Reflex-1485 次决策调用(0 次错误)· 102 次辅助模型调用(0 次 HTTP 错误 / 5 次接口约定错误) 13/35 - Laya Browser505 次决策调用(0 次错误)· 100 次辅助模型调用(0 次 HTTP 错误 / 7 次接口约定错误) 17/35 - Laya56 次决策调用(0 次错误)· 12 次辅助模型调用(0 次 HTTP 错误 / 0 次接口约定错误) 0/35 - OpenJev · DeBERTa35 次决策调用(24 次错误)· 0 次辅助模型调用(0 次 HTTP 错误 / 0 次接口约定错误) 0/35 - Kev-0.8B196 次决策调用(0 次错误)· 82 次辅助模型调用(0 次 HTTP 错误 / 0 次接口约定错误) 1/35 0255075100 此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 本地合成 WebGym 站点的真实 Chromium 录屏。每个对照组使用相同执行器、Qwen3-1.7B 文本辅助模型与 40 步上限。Reflex-1 使用 BF16 autocast,状态/请求词元上限为 1,024 / 16,384;其他运行条件保留在下载中。保留各组全部 35 次尝试、请求失败与辅助模型错误。本图与 MiniWoB++、WebArena 和真实网站评估分开。 源站点的最终状态检查记录 Reflex-1 完成 13/35,Laya Browser 完成 17/35。专用模型仍然领先;图中也展示另外三个外部对照组。 本研究中 Reflex-1 完成 13/35 项任务,Laya Browser 完成 17/35。分母保留所有尝试、失败与模型请求错误。之后在官方 MiniWoB++ 环境进行的小规模试验中,该快照完成 0/30 项任务,因此不能把合成站点结果视为该基准上的成功。 ## 决策质量 Typed Decisions 涵盖客户支持、发票处理、安全告警和智能体执行轨迹。评估保留原始状态分组,通过统一选项接口要求各模型完成相同的五项判断。Reflex-1 正确完成 1,508/2,000 项判断(75.4%)。 结构化决策 2026 年 10 月 3 日 · 开发快照 70a843878214 客户支持 精度 (%) · 越高越好准确率 · 95% 区间 - Reflex-1383/500 正确 · 0 次错误 · 0 次状态截断 76.6%95% 置信区间 72.0–80.8% - Laya · native210/500 正确 · 0 次错误 · 39 次状态截断 42.0%95% 置信区间 38.2–45.8% - OpenJev · DeBERTa206/500 正确 · 0 次错误 · 350 次状态截断 41.2%95% 置信区间 37.8–44.0% - Kev-0.8B314/500 正确 · 0 次错误 · 10 次状态截断 62.8%95% 置信区间 58.2–67.4% 0255075100 发票处理 精度 (%) · 越高越好准确率 · 95% 区间 - Reflex-1394/500 正确 · 0 次错误 · 0 次状态截断 78.8%95% 置信区间 75.0–82.4% - Laya · native192/500 正确 · 0 次错误 · 0 次状态截断 38.4%95% 置信区间 32.6–44.6% - OpenJev · DeBERTa203/500 正确 · 0 次错误 · 500 次状态截断 40.6%95% 置信区间 38.2–43.0% - Kev-0.8B252/500 正确 · 0 次错误 · 0 次状态截断 50.4%95% 置信区间 45.2–55.8% 0255075100 安全告警 精度 (%) · 越高越好准确率 · 95% 区间 - Reflex-1362/500 正确 · 0 次错误 · 0 次状态截断 72.4%95% 置信区间 68.4–76.2% - Laya · native167/500 正确 · 0 次错误 · 0 次状态截断 33.4%95% 置信区间 30.0–37.0% - OpenJev · DeBERTa210/500 正确 · 0 次错误 · 275 次状态截断 42.0%95% 置信区间 39.2–44.6% - Kev-0.8B236/500 正确 · 0 次错误 · 0 次状态截断 47.2%95% 置信区间 42.6–51.8% 0255075100 智能体执行轨迹 精度 (%) · 越高越好准确率 · 95% 区间 - Reflex-1369/500 正确 · 0 次错误 · 0 次状态截断 73.8%95% 置信区间 69.0–78.4% - Laya · native193/500 正确 · 0 次错误 · 0 次状态截断 38.6%95% 置信区间 33.4–44.0% - OpenJev · DeBERTa192/500 正确 · 0 次错误 · 0 次状态截断 38.4%95% 置信区间 34.6–42.2% - Kev-0.8B179/500 正确 · 0 次错误 · 0 次状态截断 35.8%95% 置信区间 31.6–40.4% 0255075100 此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 400 个预留源状态扩展为 2,000 项判断,每个工作流含 500 项。区间通过重采样源状态得到,同时保留五个关联输出头。 词元上限:Reflex-1: 状态 1,024, 请求 4,096; Laya · 原生: 请求 512, 指令/选项 192; OpenJev · DeBERTa: 状态 256, 请求 512; Kev-0.8B: 状态 512, 分支(包含状态)2,048。 全评估群体的指令/选项缩短次数(不能把各任务图表相加):Laya · 原生 0/2,000。这些计数与上方的状态截断次数分开。 通过统一选项接口,衡量与教师模型最常见选择的一致率。这是适配后的数据集结果,并非官方多头任务排行榜得分。 在预留的 CLINC 请求集中,Reflex-1 正确处理 3,680/4,490 个意图与范围外请求(82.0%)。陌生工具选择为 72/87,低于外部模型的最佳结果 82/87。下方同时展示优势与差距。 意图路由 2026 年 10 月 3 日 · 开发快照 70a843878214 已知与陌生请求 精度 (%) · 越高越好准确率 · 95% 区间 - Reflex-13,680/4,490 正确 · 0 次错误 · 0 次状态截断 · 64 次误拒 · 370 次误接受 82.0%95% 置信区间 80.8–83.1% - Laya · native1,425/4,490 正确 · 0 次错误 · 0 次状态截断 · 0 次误拒 · 942 次误接受 31.7%95% 置信区间 30.3–33.2% - Laya · 扩展版1,017/4,490 正确 · 0 次错误 · 0 次状态截断 · 0 次误拒 · 942 次误接受 22.7%95% 置信区间 21.4–23.9% - OpenJev · DeBERTa2,496/4,490 正确 · 0 次错误 · 0 次状态截断 · 5 次误拒 · 939 次误接受 55.6%95% 置信区间 54.1–57.0% - Kev-0.8B2,298/4,490 正确 · 0 次错误 · 0 次状态截断 · 1 次误拒 · 937 次误接受 51.2%95% 置信区间 49.6–52.6% 0255075100 此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 4,490 个预留请求:3,548 个已知意图请求与 942 个范围外请求。同时展示原生 Laya 与单独声明的扩展上下文对照。 词元上限:Reflex-1: 状态 1,024, 请求 4,096; Laya · 原生: 请求 512, 指令/选项 192; Laya · 扩展: 请求 2,048, 指令/选项 1,536; OpenJev · DeBERTa: 状态 256, 请求 512; Kev-0.8B: 状态 512, 分支(包含状态)2,048。 全评估群体的指令/选项缩短次数(不能把各任务图表相加):Laya · 原生 4,490/4,490;Laya · 扩展 0/4,490。这些计数与上方的状态截断次数分开。 Reflex-1 正确路由 3,108/3,548 个已知意图请求,并拒绝 572/942 个范围外请求。它误拒 64 个已知请求,误接受 370 个范围外请求。保留全部外部模型条件。 陌生工具选择 2026 年 10 月 3 日 · 开发快照 70a843878214 工具选择 精度 (%) · 越高越好准确率 · 95% 区间 - Reflex-172/87 正确 · 0 次错误 · 0 次状态截断 82.8%95% 置信区间 74.7–90.8% - Laya · native80/87 正确 · 0 次错误 · 14 次状态截断 92.0%95% 置信区间 86.2–97.7% - Laya · 扩展版80/87 正确 · 0 次错误 · 0 次状态截断 92.0%95% 置信区间 86.2–97.7% - OpenJev · DeBERTa82/87 正确 · 0 次错误 · 30 次状态截断 94.3%95% 置信区间 88.5–98.9% - Kev-0.8B81/87 正确 · 0 次错误 · 1 次状态截断 93.1%95% 置信区间 87.4–97.7% 0255075100 此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 87 个预留请求,其工具名称与规范化状态在训练前分离。这是工具选择适配,不涉及参数生成或执行。 词元上限:Reflex-1: 状态 1,024, 请求 4,096; Laya · 原生: 请求 512, 指令/选项 192; Laya · 扩展: 请求 2,048, 指令/选项 1,536; OpenJev · DeBERTa: 状态 256, 请求 512; Kev-0.8B: 状态 512, 分支(包含状态)2,048。 全评估群体的指令/选项缩短次数(不能把各任务图表相加):Laya · 原生 87/87;Laya · 扩展 65/87。这些计数与上方的状态截断次数分开。 Reflex-1 正确选择 72/87 个工具。Laya 在每个已声明条件下均为 80/87,OpenJev 为 82/87,Kev 为 81/87。该测试仅评估给定工具中的选择,不涵盖参数生成或执行。 这些是使用已声明评估群体的统一选项适配,并非官方排行榜提交。外部模型按原发布版本评估,未接受 Reflex-1 的任务专项训练。图表保留原始不确定性区间、词元预算和截断计数。 ## 速度与资源 本节测量对应 10 月 2 日的检查点。当前检查点的测量可在上方链接的模型卡中查看。 ### H200 请求延迟 我们在共享的 NVIDIA H200 上为每个型号重播了 120 个不同的请求。 它们来自五个游戏和浏览器环境。每个模型都收到 相同的输入,一次只能发出一个请求。 H200 请求延迟 120 次输入·两次重复·一个请求正在运行 毫秒·越低越快中位数/p95 - Reflex-1FP32 27.5 / 30.5 - OpenJevFP32 32.0 / 33.8 - Laya(原生)BF16 27.1 / 142.0 - Laya(FP32 重播)FP32 40.2 / 44.4 04080120160 点:中位数。行尾:p95。包括令牌化、评分和环回 HTTP;不包括加载和预热。 120 个相同的输入,每个输入重播两次,一个请求正在进行中。计时包括格式化、标记化、推理和环回 HTTP。跨度显示的中位数为 p95。精度因标签而异;FP32 Laya重播改变了两个决定。 完整的测量表和协议 H200 · 相同的请求·延迟以毫秒为单位·越低越好 模型 | 计算资源 | 中位数 | p95 | reflex-1 | FP32 | 27.5 | 30.5 | OpenJev | FP32 | 32.0 | 33.8 | Laya(原生) | BF16 | 27.1 | 142.0 | Laya(FP32 重播) | FP32 | 40.2 | 44.4 | Laya原生使用BF16自动播放;还包括单独的FP32重播。OpenJev 是 DeBerta 的公共检查点,而不是托管的 Jev。这些请求时间不能衡量任务成功率或并发吞吐量。录制于 2026-09-29。 reflex-1 的延迟中位数为 27.5 ms,p95 为 30.5 ms。它快于 FP32 下的 OpenJev,也快于另一次 FP32 回放中的 Laya。Laya 原生配置使用 BF16 autocast,中位数略低。由于使用共享机器且样本有限,不能对接近的结果作过度推断。 计时器包括标记化、模型评分、输出标准化和环 回 HTTP。它不包括加载和三个预热请求。答案和 选项缓存已禁用。在这次运行中,我们没有测量并发服务 吞吐量。这里的 OpenJev 是 DeBerta 的公共检查点; 它不是托管的 Jev 服务。 ### M4 CPU 延迟 CPU 测试使用了 MacBook Air M4、FP32 和批量大小 1。每个模型使用 一个 PyTorch 操作内线程、一个操作间线程和一个 BLAS 线程限制。 每项任务有 24 个不同的案例,每个案例重复 两次。模型顺序在八个执行块中进行了平衡。 M4 CPU 请求延迟 FP32 · 第一批·PyTorch 线程 1/1 · BLAS 限制 1 Banking77 毫秒·对数刻度·越小越快中位数/p95 - Reflex-1 345.2 / 692.0 - OpenJev 1,332.6 / 2,857.1 - Laya 912.4 / 2,649.9 - Kev 4,283.4 / 11,073.7 1001k10k20k Emotion 毫秒·对数刻度·越小越快中位数/p95 - Reflex-1 256.2 / 610.4 - OpenJev 381.8 / 1,029.5 - Laya 240.1 / 427.7 - Kev 1,121.9 / 4,422.3 1001k10k20k AG News 毫秒·对数刻度·越小越快中位数/p95 - Reflex-1 321.7 / 578.7 - OpenJev 424.5 / 934.0 - Laya 324.1 / 760.5 - Kev 1,356.5 / 4,997.2 1001k10k20k SST-5 毫秒·对数刻度·越小越快中位数/p95 - Reflex-1 299.1 / 631.0 - OpenJev 360.5 / 894.5 - Laya 250.7 / 548.5 - Kev 902.2 / 4,480.5 1001k10k20k BoolQ 毫秒·对数刻度·越小越快中位数/p95 - Reflex-1 463.4 / 1,329.1 - OpenJev 451.9 / 1,398.9 - Laya 440.4 / 1,587.9 - Kev 1,775.3 / 6,548.0 1001k10k20k 点表示中位数,线段末端表示 p95。所有任务使用同一对数刻度。内存:单独的 Reflex-1 回放测得峰值进程 RSS 为 1.50 GiB;本次比较未逐个测量各模型的内存。 FP32,批量大小为一;PyTorch 操作内/操作间线程数为 1/1,BLAS 线程数上限为 1。原始延迟测试中,每项任务有 24 个输入,各重复两次。单独对 Reflex-1 进行的 240 次请求回放测得峰值进程 RSS 为 1.50 GiB,涵盖加载、预热和推理。原始比较未记录各模型的内存。线段表示中位数至 p95 的范围。Laya 会截断 Banking77 的候选选项;Kev 使用未合并适配器的参考 CPU 内核。 完整的测量表和协议 M4 CPU · FP32 · PyTorch 操作内/操作间隔 1/1 · BLAS 限制 1 · 中位数/p95 以毫秒为单位 任务 | reflex-1 | OpenJev | Laya | Kev | Banking77 | 345.2/ 692.0 | 1332.6/ 2857.1 | 912.4/ 2649.9 | 4283.4/ 11073.7 | Emotion | 256.2/ 610.4 | 381.8/ 1029.5 | 240.1/ 427.7 | 1121.9/ 4422.3 | AG News | 321.7/ 578.7 | 424.5/ 934.0 | 324.1/ 760.5 | 1356.5/ 4997.2 | SST-5 | 299.1/ 631.0 | 360.5/ 894.5 | 250.7/ 548.5 | 902.2/ 4480.5 | BoolQ | 463.4/ 1329.1 | 451.9/ 1398.9 | 440.4/ 1587.9 | 1775.3/ 6548.0 | 原生运行时预算。Laya按其原有预算截断了Banking77的期权;扩大的预算结果将单独报告。Kev 使用其 CPU 参考内核和未合并的适配器。录制于 2026-09-24。 Reflex-1 实测内存:1.50 GiB 峰值进程 RSS。对最初的120个输入进行单独的Reflex-1资源回放,每个输入都得分两次。全过程峰值 RSS 包括导入、模型加载、预热和推理。最初的四种模型延迟比较没有记录每个模型的内存。录制于 2026-10-02 UTC。[资源测量和协议](https://huggingface.co/Goodailabs/reflex-1/resolve/main/assets/cpu-resources.json)。 Banking77 要求模型从 77 种意图中选择。reflex-1 的延迟中位数为 345.2 ms,同一次测试中 OpenJev 为 1,332.6 ms。五项任务中,reflex-1 的中位数在 256.2 至 463.4 ms 之间。 Laya 完成了几项小选择的任务,速度更快。其原生Banking77预算截断了期权,因此其时机涵盖了缩减的候选组合。 Kev 使用了带有未合并适配器的 CPU 参考内核。后台 笔记本电脑活动导致尾部延迟扩大。 本测试在模型已加载的条件下,计时从构建请求到返回规范化输出的全过程。CPU 和 GPU 测试使用不同的请求,不能根据这些时间直接计算 CPU 到 GPU 的加速比。 ### 熟悉任务的准确率 reflex-1在Banking77的得分为95.0%,在Emotion上得分为92.2%。它在两个 检查点的比较中均处于领先地位,在AG News和SST-5 上并列最佳分数,在BoolQ上的得分 略低于OpenJev。SST-5 决策准确性 每项任务 500 个示例·开发诊断 Banking77 精度 (%) · 越高越好记录的价值 - Reflex-1 95.0% - OpenJev 90.6% - Laya · native 44.4% - Laya · 扩展版 55.4% - Kev 82.4% 050100 Emotion 精度 (%) · 越高越好记录的价值 - Reflex-1 92.2% - OpenJev 53.0% - Laya · native 57.6% - Laya · 扩展版 57.6% - Kev 54.4% 050100 AG News 精度 (%) · 越高越好记录的价值 - Reflex-1 91.2% - OpenJev 77.4% - Laya · native 91.2% - Laya · 扩展版 91.2% - Kev 87.2% 050100 SST-5 精度 (%) · 越高越好记录的价值 - Reflex-1 59.8% - OpenJev 59.8% - Laya · native 51.0% - Laya · 扩展版 51.0% - Kev 55.2% 050100 BoolQ 精度 (%) · 越高越好记录的价值 - Reflex-1 86.0% - OpenJev 86.8% - Laya · native 71.2% - Laya · 扩展版 71.2% - Kev 82.6% 050100 任务组已纳入训练,在开发过程中对这些子集进行了检查。训练数据接触情况因模型而异。Laya的原生预算减少了Banking77的期权。 每个模型每项任务收到相同的 500 个示例。这些任务系列包含在Reflex训练中,并在开发过程中对子集进行了检查。训练数据接触情况因模型而异。扩张预算的 Laya 保留了所有 77 个 Banking77 标签。 完整的测量表和协议 准确度 (%) · 每项任务 500 个示例·开发诊断 任务 | reflex-1 | Laya,本地人 | Laya,已扩展 | OpenJev | Kev | Banking77 | 95.0 | 44.4 | 55.4 | 90.6 | 82.4 | Emotion | 92.2 | 57.6 | 57.6 | 53.0 | 54.4 | AG News | 91.2 | 91.2 | 91.2 | 77.4 | 87.2 | SST-5 | 59.8 | 51.0 | 51.0 | 59.8 | 55.2 | BoolQ | 86.0 | 71.2 | 71.2 | 86.8 | 82.6 | Laya SDK 0.3.20 显示的是原生代币预算和扩展代币预算。原生 Banking77 预算截断了选项集;扩展后的预算保留了所有 77 个标签。这些是开发诊断,不是独立的转移评估。 这些是每项任务的 500 个诊断示例。任务系列已包含 在训练中,我们在开发过程中检查了子集。不同模型的训练 预算和先前的曝光量有所不同。在更多示例中,精度与延迟是 分开测量的。 通用检查点使用我们的定制 浏览器控制器完成了 80 次试验中的 0 次。结果暴露了熟悉任务 分类和自主控制之间的巨大差距。转到不熟悉的问题 ,概率校准仍然是未解决的评估问题。 ### 训练和存储 合并适配器后,服务模型有 420,778,370 个参数。 ModernBERT对状态和问题进行编码;冻结的 MiniLM 编码器代表选择。 共同的头像组合了他们的表现形式。 reflex-1 · 服务规模和适应预算 资源 | 已录制的配置 | 服务参数 | 420,778,370 | 在适应中训练的参数 | 9,036,290 | 适配硬件 | 1 × NVIDIA H200 | 主跑 | 6,000 次更新·75 分 7 秒 | 在磁盘上提取的 FP32 模型 | ≈ 1.69 GB | 测得的 CPU 进程内存 | 1.50 GiB 峰值 RSS · 单独回放 240 个请求 | CPU 计算线程 | PyTorch 操作内/互操作 1/1 · BLAS 限制 1 | 主要改编运行使用了来自八个任务系列的290,657条记录,在6,000个步骤中更新了9,036,290个参数。 在一个 H200 上花了 75 分 7 秒,包括开发屏幕和检查点保存。基础模型 预训练、数据准备、投影拟合和早期实验 是额外的成本。 解压后的 FP32 模型在磁盘上约占 1.69 GB。单独的 CPU 资源回放测得峰值进程 RSS 为 1.50 GiB,涵盖框架分配、分词器、加载、预热和推理。GPU 内存占用尚未测量。 ## 模型访问权限 [Hugging Face 的公开](https://huggingface.co/gai-labs/reflex-1) 版本包含 1.68 GB 的 FP32 权重、两个代币生成器和 Apache 2.0 下的自成 一体 Transformers 实现。无需账户、API 密钥或 GitHub 访问权限。使用 Python 3.12: ``` python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0" ``` ``` import torch from transformers import AutoModel torch.set_num_threads(1) model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True) decision = model.predict( state="The customer was charged twice for one card payment.", question="Choose the matching issue.", options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"], )[0] print(decision.choice) ``` 加载模型一次即可重复使用。模型卡记录了批量推理、 多个问题、离线加载和发布哈希值。开发 仓库保持私有状态;公共包包含推理 所需的代码。 原始训练使用了 RACE 和 SciQ,其来源条款包含非商业使用限制。[模型卡](https://huggingface.co/gai-labs/reflex-1)记录了使用情况和固定版本。来源审查并未确定这些条款如何适用于训练后的权重。 ## 录屏与复现 使用 [Hub 上十月 3 日的固定版本](https://huggingface.co/gai-labs/reflex-1/tree/ae50bf81cddcaaac2aa18021d862433ca69da197)复现这些录像。上方图表保留了测得的结果,包括原有能力的退化。每段录像均说明环境、输入格式和播放速度。 当前版本的模型卡链接到单独的评估。这些录像和研究保留其原始结果。 也在研究中 ## 也在研究中 - ### [Samsara-VLA](https://www.goodailabs.com/zh-cn/research/samsara-vla/) 两个用于语言条件操作的紧凑机器人策略。观看它们抓取、放置、打开并完成多步骤任务。 - ### [VIO-lens-2](https://www.goodailabs.com/zh-cn/research/vio-lens-2/) 研究进行中。 信函 ## 写信给我们 如需评估、模型访问或研究合作,请联系我们。 [research@goodailabs.com](mailto:research@goodailabs.com?subject=Reflex-1)