简
联系
菜单

研究 公开权重

Reflex-1

面向智能体的决策模型

面向智能体的 421M 参数决策模型。在 CPU 或 GPU 上,一次前向传播即可完成评分。

微调后的权重已在 Hugging Face 提供。

概览

许多代理决策都以一个选择告终:哪个队列接收请求, 哪个工具适合任务,或者接下来要执行哪个操作。Reflex-1在一次正向传递 中对您的应用程序提供的选择进行评分。它返回 概率分布,应用程序可以使用该分布来做出决定。

本研究沿着 Jev 探索的决策模型方向,采用不同的架构和监督训练流程。28 层上下文编码器和六层候选编码器连接到共享评分头。当前检查点更新了全部 420,778,370 个参数。

默认公开下载的是最新微调检查点。其模型卡包含当前评估结果和 CPU 测量。下方注明日期的研究和录像保留其原始检查点标识。

决策模型

公开版本 · 运行时 1.0.0
使用
从应用程序提供的选项中进行选择:标签、路线或可能的操作。
输入 → 输出
状态、问题和 1—255 个选项 → 一次正向传递中的选择分布。
模型
421M 参数。28 层上下文编码器、6 层候选编码器和共享评分头。
在本地运行
CPU 或 GPU · FP32。当前 CPU 回放在一个或四个计算线程下测得 2.17 GiB 的进程峰值内存。
评估
在 495 条 Banking77 保留样本上达到 92.93%;原生 MiniWoB++ 完成 21/30 个回合。这些任务类型在训练中有覆盖。
获取方式
Apache 2.0 下的公共权重、分词器和推理代码。英文文本;运行时间 1.0.0。

默认下载的是最新微调检查点。下方注明日期的研究和录像对应更早的检查点。应用负责提供候选项并控制执行。

当前结果

10 月 5 日发布的模型使用固定控制器,完成了 21/30 个原生 MiniWoB++ 浏览器回合。在 495 个 Banking77 样本上的准确率为 92.93%。这些是训练中已涉及的任务类别的预留子集,并非完整基准成绩。

10 月 5 日检查点 · 预留分类评估子集
任务正确 / 评估数量准确率
AG News465 / 50093.00%
SST-5299 / 50059.80%
Emotion458 / 50091.60%
Banking77460 / 49592.93%
BoolQ171 / 20284.65%
MNLI436 / 50087.20%
RACE287 / 50057.40%
SciQ123 / 12896.09%

在 Intel Xeon Platinum 8558 CPU 上,使用四个计算线程时,Banking77 推理的中位延迟为 375.2 ms,p95 为 452.1 ms。包括加载、预热和推理在内,峰值进程内存为 2.17 GiB。

当前 CPU 测量结果

Intel Xeon Platinum 8558 · FP32 · 批大小 1

一个计算线程

延迟 · 越低越快中位数/p95
  1. AG News 1209.7 / 1385.0 ms
  2. SST-5 973.6 / 1160.3 ms
  3. Emotion 956.9 / 1165.8 ms
  4. Banking77 1101.7 / 1276.9 ms
  5. BoolQ 1600.8 / 2710.6 ms

四个计算线程

延迟 · 越低越快中位数/p95
  1. AG News 389.5 / 480.4 ms
  2. SST-5 320.6 / 404.2 ms
  3. Emotion 318.8 / 391.0 ms
  4. Banking77 375.2 / 452.1 ms
  5. BoolQ 486.7 / 782.2 ms

每种线程配置在两个新进程中对 120 个输入执行 480 次调用。计时包括分词和推理,不包括加载和预热。使用共享主机和评估运行时,不使用跨请求缓存。

完整评估尚未完成。BoolQ、RACE 和公开 JevBench 诊断的表现较上一检查点下降;原生 Dino 在 0/16 次尝试中达到 60 秒目标。当前 GPU 延迟尚未测量。已发布的评估记录了检查点、测试条件和剩余缺口。

它是如何运作的

每个请求都提供候选答案。该模型在其代币限制范围内支持每个问题 1—255 个 选项,并且多个问题可以 共享一个压缩状态。支持应用程序可以提供自己的队列; 代理可以提供其可用工具的描述。新的决策 类型需要自己的准确性测试。

模型对提供的选项进行评分;应用程序构造工具参数 并决定允许哪些操作。状态文本的上限为 512 个 上下文令牌生成器令牌,并且可以通过请求预算进一步缩短。 每个选项最多可接受 512 个期权代币生成器代币。检查state_truncated 何时可能缩短了上下文。

Reflex-1/决策模型

从问题到选择。

  1. 01 / 输入

    定义决策。

    您的应用程序提供了状态、问题及其可以据以采取行动的选择。这些选择可能会随着每个请求而改变:支持队列、可用工具或允许的操作。

    状态 + 问题

    客户被收取了两次费用。
    哪个问题匹配?

    重复收费丢失的卡未知费用现金提取
    背景 + 问题ModernBERT
    每种选择MiniLM
    共享得分头选择概率
    应用程序权限 → 论点 → 操作
    说明性支持请求。应用程序定义候选集合。
  2. 02 / 编码

    代表背景和候选人。

    经过改编的ModernBERT编码器可以读取状态和问题。冻结的 MiniLM 编码器代表每个提供的选项。几个问题可以共享一个拥挤的状态。

    状态 + 问题

    客户被收取了两次费用。
    哪个问题匹配?

    重复收费丢失的卡未知费用现金提取
    背景 + 问题ModernBERT
    每种选择MiniLM
    共享得分头选择概率
    应用程序权限 → 论点 → 操作
    两个编码器为一个共享的计分头供电。这是预览架构的示意图。
  3. 03 / 评分

    在一轮比赛中为所有提供的选项打分。

    共享头部将上下文和候选表示形式组合在一起,然后返回所提供选择的概率分布。新的决策类型仍然需要准确性和校准测试。

    状态 + 问题

    客户被收取了两次费用。
    哪个问题匹配?

    重复收费丢失的卡未知费用现金提取
    背景 + 问题ModernBERT
    每种选择MiniLM
    共享得分头选择概率
    应用程序权限 → 论点 → 操作
    每个提供的候选人一个分数,归一化为概率分布。
  4. 04 / 行动

    让应用程序执行决定。

    应用程序决定允许哪些操作,构造任何工具参数并执行所选操作。Reflex-1提供分数;周围的系统拥有控制回路。

    状态 + 问题

    客户被收取了两次费用。
    哪个问题匹配?

    重复收费丢失的卡未知费用现金提取
    背景 + 问题ModernBERT
    每种选择MiniLM
    共享得分头选择概率
    应用程序权限 → 论点 → 操作
    应用程序边界很重要:对工具进行评分并不能执行该工具。

公共开发预览版的架构。支持请求说明了输入格式。

示例

下方示例和决策质量对比使用 10 月 3 日的快照。速度与资源测量另行标注。每段录像保留实际结局,包括失败。

Chromium Dino

本录屏使用 Chromium 原版 chrome://dino 游戏。Reflex-1 接收当前可见障碍物的几何信息,选择奔跑、跳跃或下蹲。原生键盘事件执行这些选择,推理期间游戏时钟持续运行。视频以正常速度展示真实浏览器画面。

Reflex-1 · 原版 Chromium43.6 秒 无声视频
Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 游戏中使用引擎可见几何信息的结构化输入。这是 2026 年 10 月 3 日开发快照。独立赛道的完整录屏在 42.309 秒发生碰撞时结束(得分 535),未完成 60 秒时限。推理期间浏览器持续运行。 正常速度的浏览器录屏;推理期间游戏时钟持续运行。

该快照的两次尝试分别在 42.31 秒和 30.41 秒后发生碰撞,均未达到 60 秒上限。较长的一次先展示。两次使用独立随机赛道,不能据此进行配对模型比较。下方保留完整的第二次尝试。

观看第二次 Dino 尝试
Reflex-1 · 原版 Chromium31.8 秒 无声视频
Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 游戏中使用引擎可见几何信息的结构化输入。这是 2026 年 10 月 3 日开发快照。独立赛道的完整录屏在 30.410 秒发生碰撞时结束(得分 351),未完成 60 秒时限。推理期间浏览器持续运行。 正常速度的浏览器录屏;推理期间游戏时钟持续运行。

ViZDoom

游戏为原生 ViZDoom 的 Defend the Center 场景,难度为 5。Reflex-1 根据可见对象边界、生命值与弹药量选择动作。这是结构化状态控制器,并非从像素推断动作。下方保留最初预先指定的示例,仅展示 Reflex-1 视角。

Reflex-1 · 原生 ViZDoom36.5 秒 无声视频
Reflex-1 · ViZDoom. Reflex-1 在原生 ViZDoom 1.3.1 的 Defend the Center 场景中运行,难度为 5。2026 年 10 月 3 日开发快照;预先指定的录制种子为 510001。完整回合在规定 45 秒模拟时间中的 34.514 秒时死亡结束,击杀 30 个敌人。模型接收引擎可见标签与生命值/弹药量,不接收像素。播放遵循录制的模拟时间,不包含推理延迟。 按模拟时间播放,不包含推理延迟;保留原始终止画面的停留时间。

在全部 32 个预留回合中,该快照平均击杀 18.88 个敌人,存活 22.47 秒。所有回合都在 45 秒上限前结束。图表保留全部外部对比模型与完整回合计数。

ViZDoom · 击杀数与生存限制

2026 年 10 月 3 日 · 开发快照 70a843878214

Defend the Center · 难度 5

击杀数 · 越高越好均值 · 95% 区间
  1. Reflex-10/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 22.47 s 18.995% 置信区间 16.6–21.2
  2. Laya0/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 4.90 s 1.495% 置信区间 1.2–1.6
  3. OpenJev · DeBERTa0/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 4.90 s 1.495% 置信区间 1.2–1.6
  4. Kev-0.8B0/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 4.90 s 1.495% 置信区间 1.2–1.6

此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 原版 ViZDoom 引擎,结构化可见状态输入,直接执行 argmax 动作;每回合上限 45 秒。保留全部声明结果。均值区间对配对种子重采样 10,000 次。预留回合种子不能证明结构化状态未被见过。这是指定适配器/环境下的比较,并非官方基准得分或像素输入策略评估。

Reflex-1 平均击杀 18.88 个敌人、存活 22.47 秒,完整时长完成数为 0/32。Laya、OpenJev 与 Kev 均平均击杀 1.375 个,也均完成 0/32。参考模型按原发布版本使用,训练经历不同。

浏览器工作流

这些是随 Laya Browser 分发、在本地托管的合成 WebGym 站点。浏览器状态在真实 Chromium 中捕获,成功与否由原始任务检查器判定。Reflex-1 选择动作与目标,共用的 Qwen3-1.7B 辅助模型提供输入文本和下拉框值。结果衡量的是这一完整系统。

Reflex-1 · 合成 WebGym30.1 秒 · 4× 无声视频
餐厅预订 · 任务完成. 10 月 3 日开发快照;15 个动作。在 Chromium 中捕获浏览器状态,以实际时间的 4× 速度回放,保留完整结局与终止画面的停留。 本地合成任务,共用 Qwen3-1.7B 文本辅助模型。该快照与 Hub 默认权重不同。
Reflex-1 · 合成 WebGym8.1 秒 · 4× 无声视频
购物任务 · 目标未完成. 10 月 3 日开发快照;4 个动作。在 Chromium 中捕获浏览器状态,以实际时间的 4× 速度回放,保留完整结局与终止画面的停留。 本地合成任务,共用 Qwen3-1.7B 文本辅助模型。该快照与 Hub 默认权重不同。

餐厅任务成功,购物任务失败。两者使用同一预先指定的任务种子,保留录制结局。视频按原始实际时间的 4× 速度回放浏览器状态,并保留终止画面的停留时间。这些是合成站点上的开发结果,不是 MiniWoB++、WebArena 或真实网站得分。

浏览器任务完成率 · 合成 WebGym

2026 年 10 月 3 日 · 开发快照 70a843878214
完成回合(%)· 越高越好记录的价值
  1. Reflex-1485 次决策调用(0 次错误)· 102 次辅助模型调用(0 次 HTTP 错误 / 5 次接口约定错误) 13/35
  2. Laya Browser505 次决策调用(0 次错误)· 100 次辅助模型调用(0 次 HTTP 错误 / 7 次接口约定错误) 17/35
  3. Laya56 次决策调用(0 次错误)· 12 次辅助模型调用(0 次 HTTP 错误 / 0 次接口约定错误) 0/35
  4. OpenJev · DeBERTa35 次决策调用(24 次错误)· 0 次辅助模型调用(0 次 HTTP 错误 / 0 次接口约定错误) 0/35
  5. Kev-0.8B196 次决策调用(0 次错误)· 82 次辅助模型调用(0 次 HTTP 错误 / 0 次接口约定错误) 1/35

此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 本地合成 WebGym 站点的真实 Chromium 录屏。每个对照组使用相同执行器、Qwen3-1.7B 文本辅助模型与 40 步上限。Reflex-1 使用 BF16 autocast,状态/请求词元上限为 1,024 / 16,384;其他运行条件保留在下载中。保留各组全部 35 次尝试、请求失败与辅助模型错误。本图与 MiniWoB++、WebArena 和真实网站评估分开。

源站点的最终状态检查记录 Reflex-1 完成 13/35,Laya Browser 完成 17/35。专用模型仍然领先;图中也展示另外三个外部对照组。

本研究中 Reflex-1 完成 13/35 项任务,Laya Browser 完成 17/35。分母保留所有尝试、失败与模型请求错误。之后在官方 MiniWoB++ 环境进行的小规模试验中,该快照完成 0/30 项任务,因此不能把合成站点结果视为该基准上的成功。

决策质量

Typed Decisions 涵盖客户支持、发票处理、安全告警和智能体执行轨迹。评估保留原始状态分组,通过统一选项接口要求各模型完成相同的五项判断。Reflex-1 正确完成 1,508/2,000 项判断(75.4%)。

结构化决策

2026 年 10 月 3 日 · 开发快照 70a843878214

客户支持

精度 (%) · 越高越好准确率 · 95% 区间
  1. Reflex-1383/500 正确 · 0 次错误 · 0 次状态截断 76.6%95% 置信区间 72.0–80.8%
  2. Laya · native210/500 正确 · 0 次错误 · 39 次状态截断 42.0%95% 置信区间 38.2–45.8%
  3. OpenJev · DeBERTa206/500 正确 · 0 次错误 · 350 次状态截断 41.2%95% 置信区间 37.8–44.0%
  4. Kev-0.8B314/500 正确 · 0 次错误 · 10 次状态截断 62.8%95% 置信区间 58.2–67.4%

发票处理

精度 (%) · 越高越好准确率 · 95% 区间
  1. Reflex-1394/500 正确 · 0 次错误 · 0 次状态截断 78.8%95% 置信区间 75.0–82.4%
  2. Laya · native192/500 正确 · 0 次错误 · 0 次状态截断 38.4%95% 置信区间 32.6–44.6%
  3. OpenJev · DeBERTa203/500 正确 · 0 次错误 · 500 次状态截断 40.6%95% 置信区间 38.2–43.0%
  4. Kev-0.8B252/500 正确 · 0 次错误 · 0 次状态截断 50.4%95% 置信区间 45.2–55.8%

安全告警

精度 (%) · 越高越好准确率 · 95% 区间
  1. Reflex-1362/500 正确 · 0 次错误 · 0 次状态截断 72.4%95% 置信区间 68.4–76.2%
  2. Laya · native167/500 正确 · 0 次错误 · 0 次状态截断 33.4%95% 置信区间 30.0–37.0%
  3. OpenJev · DeBERTa210/500 正确 · 0 次错误 · 275 次状态截断 42.0%95% 置信区间 39.2–44.6%
  4. Kev-0.8B236/500 正确 · 0 次错误 · 0 次状态截断 47.2%95% 置信区间 42.6–51.8%

智能体执行轨迹

精度 (%) · 越高越好准确率 · 95% 区间
  1. Reflex-1369/500 正确 · 0 次错误 · 0 次状态截断 73.8%95% 置信区间 69.0–78.4%
  2. Laya · native193/500 正确 · 0 次错误 · 0 次状态截断 38.6%95% 置信区间 33.4–44.0%
  3. OpenJev · DeBERTa192/500 正确 · 0 次错误 · 0 次状态截断 38.4%95% 置信区间 34.6–42.2%
  4. Kev-0.8B179/500 正确 · 0 次错误 · 0 次状态截断 35.8%95% 置信区间 31.6–40.4%

此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 400 个预留源状态扩展为 2,000 项判断,每个工作流含 500 项。区间通过重采样源状态得到,同时保留五个关联输出头。 词元上限:Reflex-1: 状态 1,024, 请求 4,096; Laya · 原生: 请求 512, 指令/选项 192; OpenJev · DeBERTa: 状态 256, 请求 512; Kev-0.8B: 状态 512, 分支(包含状态)2,048。 全评估群体的指令/选项缩短次数(不能把各任务图表相加):Laya · 原生 0/2,000。这些计数与上方的状态截断次数分开。

通过统一选项接口,衡量与教师模型最常见选择的一致率。这是适配后的数据集结果,并非官方多头任务排行榜得分。

在预留的 CLINC 请求集中,Reflex-1 正确处理 3,680/4,490 个意图与范围外请求(82.0%)。陌生工具选择为 72/87,低于外部模型的最佳结果 82/87。下方同时展示优势与差距。

意图路由

2026 年 10 月 3 日 · 开发快照 70a843878214

已知与陌生请求

精度 (%) · 越高越好准确率 · 95% 区间
  1. Reflex-13,680/4,490 正确 · 0 次错误 · 0 次状态截断 · 64 次误拒 · 370 次误接受 82.0%95% 置信区间 80.8–83.1%
  2. Laya · native1,425/4,490 正确 · 0 次错误 · 0 次状态截断 · 0 次误拒 · 942 次误接受 31.7%95% 置信区间 30.3–33.2%
  3. Laya · 扩展版1,017/4,490 正确 · 0 次错误 · 0 次状态截断 · 0 次误拒 · 942 次误接受 22.7%95% 置信区间 21.4–23.9%
  4. OpenJev · DeBERTa2,496/4,490 正确 · 0 次错误 · 0 次状态截断 · 5 次误拒 · 939 次误接受 55.6%95% 置信区间 54.1–57.0%
  5. Kev-0.8B2,298/4,490 正确 · 0 次错误 · 0 次状态截断 · 1 次误拒 · 937 次误接受 51.2%95% 置信区间 49.6–52.6%

此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 4,490 个预留请求:3,548 个已知意图请求与 942 个范围外请求。同时展示原生 Laya 与单独声明的扩展上下文对照。 词元上限:Reflex-1: 状态 1,024, 请求 4,096; Laya · 原生: 请求 512, 指令/选项 192; Laya · 扩展: 请求 2,048, 指令/选项 1,536; OpenJev · DeBERTa: 状态 256, 请求 512; Kev-0.8B: 状态 512, 分支(包含状态)2,048。 全评估群体的指令/选项缩短次数(不能把各任务图表相加):Laya · 原生 4,490/4,490;Laya · 扩展 0/4,490。这些计数与上方的状态截断次数分开。

Reflex-1 正确路由 3,108/3,548 个已知意图请求,并拒绝 572/942 个范围外请求。它误拒 64 个已知请求,误接受 370 个范围外请求。保留全部外部模型条件。

陌生工具选择

2026 年 10 月 3 日 · 开发快照 70a843878214

工具选择

精度 (%) · 越高越好准确率 · 95% 区间
  1. Reflex-172/87 正确 · 0 次错误 · 0 次状态截断 82.8%95% 置信区间 74.7–90.8%
  2. Laya · native80/87 正确 · 0 次错误 · 14 次状态截断 92.0%95% 置信区间 86.2–97.7%
  3. Laya · 扩展版80/87 正确 · 0 次错误 · 0 次状态截断 92.0%95% 置信区间 86.2–97.7%
  4. OpenJev · DeBERTa82/87 正确 · 0 次错误 · 30 次状态截断 94.3%95% 置信区间 88.5–98.9%
  5. Kev-0.8B81/87 正确 · 0 次错误 · 1 次状态截断 93.1%95% 置信区间 87.4–97.7%

此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 87 个预留请求,其工具名称与规范化状态在训练前分离。这是工具选择适配,不涉及参数生成或执行。 词元上限:Reflex-1: 状态 1,024, 请求 4,096; Laya · 原生: 请求 512, 指令/选项 192; Laya · 扩展: 请求 2,048, 指令/选项 1,536; OpenJev · DeBERTa: 状态 256, 请求 512; Kev-0.8B: 状态 512, 分支(包含状态)2,048。 全评估群体的指令/选项缩短次数(不能把各任务图表相加):Laya · 原生 87/87;Laya · 扩展 65/87。这些计数与上方的状态截断次数分开。

Reflex-1 正确选择 72/87 个工具。Laya 在每个已声明条件下均为 80/87,OpenJev 为 82/87,Kev 为 81/87。该测试仅评估给定工具中的选择,不涵盖参数生成或执行。

这些是使用已声明评估群体的统一选项适配,并非官方排行榜提交。外部模型按原发布版本评估,未接受 Reflex-1 的任务专项训练。图表保留原始不确定性区间、词元预算和截断计数。

速度与资源

本节测量对应 10 月 2 日的检查点。当前检查点的测量可在上方链接的模型卡中查看。

H200 请求延迟

我们在共享的 NVIDIA H200 上为每个型号重播了 120 个不同的请求。 它们来自五个游戏和浏览器环境。每个模型都收到 相同的输入,一次只能发出一个请求。

H200 请求延迟

120 次输入·两次重复·一个请求正在运行
毫秒·越低越快中位数/p95
  1. Reflex-1FP32 27.5 / 30.5
  2. OpenJevFP32 32.0 / 33.8
  3. Laya(原生)BF16 27.1 / 142.0
  4. Laya(FP32 重播)FP32 40.2 / 44.4

点:中位数。行尾:p95。包括令牌化、评分和环回 HTTP;不包括加载和预热。

120 个相同的输入,每个输入重播两次,一个请求正在进行中。计时包括格式化、标记化、推理和环回 HTTP。跨度显示的中位数为 p95。精度因标签而异;FP32 Laya重播改变了两个决定。
完整的测量表和协议
H200 · 相同的请求·延迟以毫秒为单位·越低越好
模型计算资源中位数p95
reflex-1FP3227.530.5
OpenJevFP3232.033.8
Laya(原生)BF1627.1142.0
Laya(FP32 重播)FP3240.244.4

Laya原生使用BF16自动播放;还包括单独的FP32重播。OpenJev 是 DeBerta 的公共检查点,而不是托管的 Jev。这些请求时间不能衡量任务成功率或并发吞吐量。录制于 2026-09-29。

reflex-1 的延迟中位数为 27.5 ms,p95 为 30.5 ms。它快于 FP32 下的 OpenJev,也快于另一次 FP32 回放中的 Laya。Laya 原生配置使用 BF16 autocast,中位数略低。由于使用共享机器且样本有限,不能对接近的结果作过度推断。

计时器包括标记化、模型评分、输出标准化和环 回 HTTP。它不包括加载和三个预热请求。答案和 选项缓存已禁用。在这次运行中,我们没有测量并发服务 吞吐量。这里的 OpenJev 是 DeBerta 的公共检查点; 它不是托管的 Jev 服务。

M4 CPU 延迟

CPU 测试使用了 MacBook Air M4、FP32 和批量大小 1。每个模型使用 一个 PyTorch 操作内线程、一个操作间线程和一个 BLAS 线程限制。 每项任务有 24 个不同的案例,每个案例重复 两次。模型顺序在八个执行块中进行了平衡。

M4 CPU 请求延迟

FP32 · 第一批·PyTorch 线程 1/1 · BLAS 限制 1

Banking77

毫秒·对数刻度·越小越快中位数/p95
  1. Reflex-1 345.2 / 692.0
  2. OpenJev 1,332.6 / 2,857.1
  3. Laya 912.4 / 2,649.9
  4. Kev 4,283.4 / 11,073.7

Emotion

毫秒·对数刻度·越小越快中位数/p95
  1. Reflex-1 256.2 / 610.4
  2. OpenJev 381.8 / 1,029.5
  3. Laya 240.1 / 427.7
  4. Kev 1,121.9 / 4,422.3

AG News

毫秒·对数刻度·越小越快中位数/p95
  1. Reflex-1 321.7 / 578.7
  2. OpenJev 424.5 / 934.0
  3. Laya 324.1 / 760.5
  4. Kev 1,356.5 / 4,997.2

SST-5

毫秒·对数刻度·越小越快中位数/p95
  1. Reflex-1 299.1 / 631.0
  2. OpenJev 360.5 / 894.5
  3. Laya 250.7 / 548.5
  4. Kev 902.2 / 4,480.5

BoolQ

毫秒·对数刻度·越小越快中位数/p95
  1. Reflex-1 463.4 / 1,329.1
  2. OpenJev 451.9 / 1,398.9
  3. Laya 440.4 / 1,587.9
  4. Kev 1,775.3 / 6,548.0

点表示中位数,线段末端表示 p95。所有任务使用同一对数刻度。内存:单独的 Reflex-1 回放测得峰值进程 RSS 为 1.50 GiB;本次比较未逐个测量各模型的内存。

FP32,批量大小为一;PyTorch 操作内/操作间线程数为 1/1,BLAS 线程数上限为 1。原始延迟测试中,每项任务有 24 个输入,各重复两次。单独对 Reflex-1 进行的 240 次请求回放测得峰值进程 RSS 为 1.50 GiB,涵盖加载、预热和推理。原始比较未记录各模型的内存。线段表示中位数至 p95 的范围。Laya 会截断 Banking77 的候选选项;Kev 使用未合并适配器的参考 CPU 内核。
完整的测量表和协议
M4 CPU · FP32 · PyTorch 操作内/操作间隔 1/1 · BLAS 限制 1 · 中位数/p95 以毫秒为单位
任务reflex-1OpenJevLayaKev
Banking77345.2/ 692.01332.6/ 2857.1912.4/ 2649.94283.4/ 11073.7
Emotion256.2/ 610.4381.8/ 1029.5240.1/ 427.71121.9/ 4422.3
AG News321.7/ 578.7424.5/ 934.0324.1/ 760.51356.5/ 4997.2
SST-5299.1/ 631.0360.5/ 894.5250.7/ 548.5902.2/ 4480.5
BoolQ463.4/ 1329.1451.9/ 1398.9440.4/ 1587.91775.3/ 6548.0

原生运行时预算。Laya按其原有预算截断了Banking77的期权;扩大的预算结果将单独报告。Kev 使用其 CPU 参考内核和未合并的适配器。录制于 2026-09-24。

Reflex-1 实测内存:1.50 GiB 峰值进程 RSS。对最初的120个输入进行单独的Reflex-1资源回放,每个输入都得分两次。全过程峰值 RSS 包括导入、模型加载、预热和推理。最初的四种模型延迟比较没有记录每个模型的内存。录制于 2026-10-02 UTC。资源测量和协议。

Banking77 要求模型从 77 种意图中选择。reflex-1 的延迟中位数为 345.2 ms,同一次测试中 OpenJev 为 1,332.6 ms。五项任务中,reflex-1 的中位数在 256.2 至 463.4 ms 之间。

Laya 完成了几项小选择的任务,速度更快。其原生Banking77预算截断了期权,因此其时机涵盖了缩减的候选组合。 Kev 使用了带有未合并适配器的 CPU 参考内核。后台 笔记本电脑活动导致尾部延迟扩大。

本测试在模型已加载的条件下,计时从构建请求到返回规范化输出的全过程。CPU 和 GPU 测试使用不同的请求,不能根据这些时间直接计算 CPU 到 GPU 的加速比。

熟悉任务的准确率

reflex-1在Banking77的得分为95.0%,在Emotion上得分为92.2%。它在两个 检查点的比较中均处于领先地位,在AG News和SST-5 上并列最佳分数,在BoolQ上的得分 略低于OpenJev。SST-5

决策准确性

每项任务 500 个示例·开发诊断

Banking77

精度 (%) · 越高越好记录的价值
  1. Reflex-1 95.0%
  2. OpenJev 90.6%
  3. Laya · native 44.4%
  4. Laya · 扩展版 55.4%
  5. Kev 82.4%

Emotion

精度 (%) · 越高越好记录的价值
  1. Reflex-1 92.2%
  2. OpenJev 53.0%
  3. Laya · native 57.6%
  4. Laya · 扩展版 57.6%
  5. Kev 54.4%

AG News

精度 (%) · 越高越好记录的价值
  1. Reflex-1 91.2%
  2. OpenJev 77.4%
  3. Laya · native 91.2%
  4. Laya · 扩展版 91.2%
  5. Kev 87.2%

SST-5

精度 (%) · 越高越好记录的价值
  1. Reflex-1 59.8%
  2. OpenJev 59.8%
  3. Laya · native 51.0%
  4. Laya · 扩展版 51.0%
  5. Kev 55.2%

BoolQ

精度 (%) · 越高越好记录的价值
  1. Reflex-1 86.0%
  2. OpenJev 86.8%
  3. Laya · native 71.2%
  4. Laya · 扩展版 71.2%
  5. Kev 82.6%

任务组已纳入训练,在开发过程中对这些子集进行了检查。训练数据接触情况因模型而异。Laya的原生预算减少了Banking77的期权。

每个模型每项任务收到相同的 500 个示例。这些任务系列包含在Reflex训练中,并在开发过程中对子集进行了检查。训练数据接触情况因模型而异。扩张预算的 Laya 保留了所有 77 个 Banking77 标签。
完整的测量表和协议
准确度 (%) · 每项任务 500 个示例·开发诊断
任务reflex-1Laya,本地人Laya,已扩展OpenJevKev
Banking7795.044.455.490.682.4
Emotion92.257.657.653.054.4
AG News91.291.291.277.487.2
SST-559.851.051.059.855.2
BoolQ86.071.271.286.882.6

Laya SDK 0.3.20 显示的是原生代币预算和扩展代币预算。原生 Banking77 预算截断了选项集;扩展后的预算保留了所有 77 个标签。这些是开发诊断,不是独立的转移评估。

这些是每项任务的 500 个诊断示例。任务系列已包含 在训练中,我们在开发过程中检查了子集。不同模型的训练 预算和先前的曝光量有所不同。在更多示例中,精度与延迟是 分开测量的。

通用检查点使用我们的定制 浏览器控制器完成了 80 次试验中的 0 次。结果暴露了熟悉任务 分类和自主控制之间的巨大差距。转到不熟悉的问题 ,概率校准仍然是未解决的评估问题。

训练和存储

合并适配器后,服务模型有 420,778,370 个参数。 ModernBERT对状态和问题进行编码;冻结的 MiniLM 编码器代表选择。 共同的头像组合了他们的表现形式。

reflex-1 · 服务规模和适应预算
资源已录制的配置
服务参数420,778,370
在适应中训练的参数9,036,290
适配硬件1 × NVIDIA H200
主跑6,000 次更新·75 分 7 秒
在磁盘上提取的 FP32 模型≈ 1.69 GB
测得的 CPU 进程内存1.50 GiB 峰值 RSS · 单独回放 240 个请求
CPU 计算线程PyTorch 操作内/互操作 1/1 · BLAS 限制 1

主要改编运行使用了来自八个任务系列的290,657条记录,在6,000个步骤中更新了9,036,290个参数。 在一个 H200 上花了 75 分 7 秒,包括开发屏幕和检查点保存。基础模型 预训练、数据准备、投影拟合和早期实验 是额外的成本。

解压后的 FP32 模型在磁盘上约占 1.69 GB。单独的 CPU 资源回放测得峰值进程 RSS 为 1.50 GiB,涵盖框架分配、分词器、加载、预热和推理。GPU 内存占用尚未测量。

模型访问权限

Hugging Face 的公开 版本包含 1.68 GB 的 FP32 权重、两个代币生成器和 Apache 2.0 下的自成 一体 Transformers 实现。无需账户、API 密钥或 GitHub 访问权限。使用 Python 3.12:

python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0"
import torch
from transformers import AutoModel

torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)

decision = model.predict(
    state="The customer was charged twice for one card payment.",
    question="Choose the matching issue.",
    options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)

加载模型一次即可重复使用。模型卡记录了批量推理、 多个问题、离线加载和发布哈希值。开发 仓库保持私有状态;公共包包含推理 所需的代码。

原始训练使用了 RACE 和 SciQ,其来源条款包含非商业使用限制。模型卡记录了使用情况和固定版本。来源审查并未确定这些条款如何适用于训练后的权重。

录屏与复现

使用 Hub 上十月 3 日的固定版本复现这些录像。上方图表保留了测得的结果,包括原有能力的退化。每段录像均说明环境、输入格式和播放速度。

当前版本的模型卡链接到单独的评估。这些录像和研究保留其原始结果。

也在研究中

  • Samsara-VLA

    两个用于语言条件操作的紧凑机器人策略。观看它们抓取、放置、打开并完成多步骤任务。

  • VIO-lens-2

    研究进行中。

信函

写信给我们

如需评估、模型访问或研究合作,请联系我们。

research@goodailabs.com