研究 公开权重
Reflex-1
面向智能体的决策模型
面向智能体的 421M 参数决策模型。在 CPU 或 GPU 上,一次前向传播即可完成评分。
微调后的权重已在 Hugging Face 提供。
概览
许多代理决策都以一个选择告终:哪个队列接收请求, 哪个工具适合任务,或者接下来要执行哪个操作。Reflex-1在一次正向传递 中对您的应用程序提供的选择进行评分。它返回 概率分布,应用程序可以使用该分布来做出决定。
本研究沿着 Jev 探索的决策模型方向,采用不同的架构和监督训练流程。28 层上下文编码器和六层候选编码器连接到共享评分头。当前检查点更新了全部 420,778,370 个参数。
默认公开下载的是最新微调检查点。其模型卡包含当前评估结果和 CPU 测量。下方注明日期的研究和录像保留其原始检查点标识。
决策模型
公开版本 · 运行时 1.0.0- 使用
- 从应用程序提供的选项中进行选择:标签、路线或可能的操作。
- 输入 → 输出
- 状态、问题和 1—255 个选项 → 一次正向传递中的选择分布。
- 模型
- 421M 参数。28 层上下文编码器、6 层候选编码器和共享评分头。
- 在本地运行
- CPU 或 GPU · FP32。当前 CPU 回放在一个或四个计算线程下测得 2.17 GiB 的进程峰值内存。
- 评估
- 在 495 条 Banking77 保留样本上达到 92.93%;原生 MiniWoB++ 完成 21/30 个回合。这些任务类型在训练中有覆盖。
- 获取方式
- Apache 2.0 下的公共权重、分词器和推理代码。英文文本;运行时间 1.0.0。
默认下载的是最新微调检查点。下方注明日期的研究和录像对应更早的检查点。应用负责提供候选项并控制执行。
当前结果
10 月 5 日发布的模型使用固定控制器,完成了 21/30 个原生 MiniWoB++ 浏览器回合。在 495 个 Banking77 样本上的准确率为 92.93%。这些是训练中已涉及的任务类别的预留子集,并非完整基准成绩。
| 任务 | 正确 / 评估数量 | 准确率 |
|---|---|---|
| AG News | 465 / 500 | 93.00% |
| SST-5 | 299 / 500 | 59.80% |
| Emotion | 458 / 500 | 91.60% |
| Banking77 | 460 / 495 | 92.93% |
| BoolQ | 171 / 202 | 84.65% |
| MNLI | 436 / 500 | 87.20% |
| RACE | 287 / 500 | 57.40% |
| SciQ | 123 / 128 | 96.09% |
在 Intel Xeon Platinum 8558 CPU 上,使用四个计算线程时,Banking77 推理的中位延迟为 375.2 ms,p95 为 452.1 ms。包括加载、预热和推理在内,峰值进程内存为 2.17 GiB。
当前 CPU 测量结果
Intel Xeon Platinum 8558 · FP32 · 批大小 1一个计算线程
- AG News 1209.7 / 1385.0 ms
- SST-5 973.6 / 1160.3 ms
- Emotion 956.9 / 1165.8 ms
- Banking77 1101.7 / 1276.9 ms
- BoolQ 1600.8 / 2710.6 ms
四个计算线程
- AG News 389.5 / 480.4 ms
- SST-5 320.6 / 404.2 ms
- Emotion 318.8 / 391.0 ms
- Banking77 375.2 / 452.1 ms
- BoolQ 486.7 / 782.2 ms
每种线程配置在两个新进程中对 120 个输入执行 480 次调用。计时包括分词和推理,不包括加载和预热。使用共享主机和评估运行时,不使用跨请求缓存。
完整评估尚未完成。BoolQ、RACE 和公开 JevBench 诊断的表现较上一检查点下降;原生 Dino 在 0/16 次尝试中达到 60 秒目标。当前 GPU 延迟尚未测量。已发布的评估记录了检查点、测试条件和剩余缺口。
它是如何运作的
每个请求都提供候选答案。该模型在其代币限制范围内支持每个问题 1—255 个 选项,并且多个问题可以 共享一个压缩状态。支持应用程序可以提供自己的队列; 代理可以提供其可用工具的描述。新的决策 类型需要自己的准确性测试。
模型对提供的选项进行评分;应用程序构造工具参数
并决定允许哪些操作。状态文本的上限为 512 个
上下文令牌生成器令牌,并且可以通过请求预算进一步缩短。
每个选项最多可接受 512 个期权代币生成器代币。检查state_truncated
何时可能缩短了上下文。
Reflex-1/决策模型
从问题到选择。
01 / 输入
定义决策。
您的应用程序提供了状态、问题及其可以据以采取行动的选择。这些选择可能会随着每个请求而改变:支持队列、可用工具或允许的操作。
状态 + 问题
客户被收取了两次费用。
哪个问题匹配?背景 + 问题ModernBERT每种选择MiniLM共享得分头选择概率应用程序权限 → 论点 → 操作说明性支持请求。应用程序定义候选集合。 02 / 编码
代表背景和候选人。
经过改编的ModernBERT编码器可以读取状态和问题。冻结的 MiniLM 编码器代表每个提供的选项。几个问题可以共享一个拥挤的状态。
状态 + 问题
客户被收取了两次费用。
哪个问题匹配?背景 + 问题ModernBERT每种选择MiniLM共享得分头选择概率应用程序权限 → 论点 → 操作两个编码器为一个共享的计分头供电。这是预览架构的示意图。 03 / 评分
在一轮比赛中为所有提供的选项打分。
共享头部将上下文和候选表示形式组合在一起,然后返回所提供选择的概率分布。新的决策类型仍然需要准确性和校准测试。
状态 + 问题
客户被收取了两次费用。
哪个问题匹配?背景 + 问题ModernBERT每种选择MiniLM共享得分头选择概率应用程序权限 → 论点 → 操作每个提供的候选人一个分数,归一化为概率分布。 04 / 行动
让应用程序执行决定。
应用程序决定允许哪些操作,构造任何工具参数并执行所选操作。Reflex-1提供分数;周围的系统拥有控制回路。
状态 + 问题
客户被收取了两次费用。
哪个问题匹配?背景 + 问题ModernBERT每种选择MiniLM共享得分头选择概率应用程序权限 → 论点 → 操作应用程序边界很重要:对工具进行评分并不能执行该工具。
公共开发预览版的架构。支持请求说明了输入格式。
示例
下方示例和决策质量对比使用 10 月 3 日的快照。速度与资源测量另行标注。每段录像保留实际结局,包括失败。
Chromium Dino
本录屏使用 Chromium 原版 chrome://dino 游戏。Reflex-1 接收当前可见障碍物的几何信息,选择奔跑、跳跃或下蹲。原生键盘事件执行这些选择,推理期间游戏时钟持续运行。视频以正常速度展示真实浏览器画面。
该快照的两次尝试分别在 42.31 秒和 30.41 秒后发生碰撞,均未达到 60 秒上限。较长的一次先展示。两次使用独立随机赛道,不能据此进行配对模型比较。下方保留完整的第二次尝试。
观看第二次 Dino 尝试
ViZDoom
游戏为原生 ViZDoom 的 Defend the Center 场景,难度为 5。Reflex-1 根据可见对象边界、生命值与弹药量选择动作。这是结构化状态控制器,并非从像素推断动作。下方保留最初预先指定的示例,仅展示 Reflex-1 视角。
在全部 32 个预留回合中,该快照平均击杀 18.88 个敌人,存活 22.47 秒。所有回合都在 45 秒上限前结束。图表保留全部外部对比模型与完整回合计数。
ViZDoom · 击杀数与生存限制
2026 年 10 月 3 日 · 开发快照 70a843878214Defend the Center · 难度 5
- Reflex-10/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 22.47 s 18.995% 置信区间 16.6–21.2
- Laya0/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 4.90 s 1.495% 置信区间 1.2–1.6
- OpenJev · DeBERTa0/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 4.90 s 1.495% 置信区间 1.2–1.6
- Kev-0.8B0/32 达到 45 s · 32 次死亡 · 0 次错误 · 平均存活 4.90 s 1.495% 置信区间 1.2–1.6
此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 原版 ViZDoom 引擎,结构化可见状态输入,直接执行 argmax 动作;每回合上限 45 秒。保留全部声明结果。均值区间对配对种子重采样 10,000 次。预留回合种子不能证明结构化状态未被见过。这是指定适配器/环境下的比较,并非官方基准得分或像素输入策略评估。
浏览器工作流
这些是随 Laya Browser 分发、在本地托管的合成 WebGym 站点。浏览器状态在真实 Chromium 中捕获,成功与否由原始任务检查器判定。Reflex-1 选择动作与目标,共用的 Qwen3-1.7B 辅助模型提供输入文本和下拉框值。结果衡量的是这一完整系统。
餐厅任务成功,购物任务失败。两者使用同一预先指定的任务种子,保留录制结局。视频按原始实际时间的 4× 速度回放浏览器状态,并保留终止画面的停留时间。这些是合成站点上的开发结果,不是 MiniWoB++、WebArena 或真实网站得分。
浏览器任务完成率 · 合成 WebGym
2026 年 10 月 3 日 · 开发快照 70a843878214- Reflex-1485 次决策调用(0 次错误)· 102 次辅助模型调用(0 次 HTTP 错误 / 5 次接口约定错误) 13/35
- Laya Browser505 次决策调用(0 次错误)· 100 次辅助模型调用(0 次 HTTP 错误 / 7 次接口约定错误) 17/35
- Laya56 次决策调用(0 次错误)· 12 次辅助模型调用(0 次 HTTP 错误 / 0 次接口约定错误) 0/35
- OpenJev · DeBERTa35 次决策调用(24 次错误)· 0 次辅助模型调用(0 次 HTTP 错误 / 0 次接口约定错误) 0/35
- Kev-0.8B196 次决策调用(0 次错误)· 82 次辅助模型调用(0 次 HTTP 错误 / 0 次接口约定错误) 1/35
此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 本地合成 WebGym 站点的真实 Chromium 录屏。每个对照组使用相同执行器、Qwen3-1.7B 文本辅助模型与 40 步上限。Reflex-1 使用 BF16 autocast,状态/请求词元上限为 1,024 / 16,384;其他运行条件保留在下载中。保留各组全部 35 次尝试、请求失败与辅助模型错误。本图与 MiniWoB++、WebArena 和真实网站评估分开。
本研究中 Reflex-1 完成 13/35 项任务,Laya Browser 完成 17/35。分母保留所有尝试、失败与模型请求错误。之后在官方 MiniWoB++ 环境进行的小规模试验中,该快照完成 0/30 项任务,因此不能把合成站点结果视为该基准上的成功。
决策质量
Typed Decisions 涵盖客户支持、发票处理、安全告警和智能体执行轨迹。评估保留原始状态分组,通过统一选项接口要求各模型完成相同的五项判断。Reflex-1 正确完成 1,508/2,000 项判断(75.4%)。
结构化决策
2026 年 10 月 3 日 · 开发快照 70a843878214客户支持
- Reflex-1383/500 正确 · 0 次错误 · 0 次状态截断 76.6%95% 置信区间 72.0–80.8%
- Laya · native210/500 正确 · 0 次错误 · 39 次状态截断 42.0%95% 置信区间 38.2–45.8%
- OpenJev · DeBERTa206/500 正确 · 0 次错误 · 350 次状态截断 41.2%95% 置信区间 37.8–44.0%
- Kev-0.8B314/500 正确 · 0 次错误 · 10 次状态截断 62.8%95% 置信区间 58.2–67.4%
发票处理
- Reflex-1394/500 正确 · 0 次错误 · 0 次状态截断 78.8%95% 置信区间 75.0–82.4%
- Laya · native192/500 正确 · 0 次错误 · 0 次状态截断 38.4%95% 置信区间 32.6–44.6%
- OpenJev · DeBERTa203/500 正确 · 0 次错误 · 500 次状态截断 40.6%95% 置信区间 38.2–43.0%
- Kev-0.8B252/500 正确 · 0 次错误 · 0 次状态截断 50.4%95% 置信区间 45.2–55.8%
安全告警
- Reflex-1362/500 正确 · 0 次错误 · 0 次状态截断 72.4%95% 置信区间 68.4–76.2%
- Laya · native167/500 正确 · 0 次错误 · 0 次状态截断 33.4%95% 置信区间 30.0–37.0%
- OpenJev · DeBERTa210/500 正确 · 0 次错误 · 275 次状态截断 42.0%95% 置信区间 39.2–44.6%
- Kev-0.8B236/500 正确 · 0 次错误 · 0 次状态截断 47.2%95% 置信区间 42.6–51.8%
智能体执行轨迹
- Reflex-1369/500 正确 · 0 次错误 · 0 次状态截断 73.8%95% 置信区间 69.0–78.4%
- Laya · native193/500 正确 · 0 次错误 · 0 次状态截断 38.6%95% 置信区间 33.4–44.0%
- OpenJev · DeBERTa192/500 正确 · 0 次错误 · 0 次状态截断 38.4%95% 置信区间 34.6–42.2%
- Kev-0.8B179/500 正确 · 0 次错误 · 0 次状态截断 35.8%95% 置信区间 31.6–40.4%
此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 400 个预留源状态扩展为 2,000 项判断,每个工作流含 500 项。区间通过重采样源状态得到,同时保留五个关联输出头。 词元上限:Reflex-1: 状态 1,024, 请求 4,096; Laya · 原生: 请求 512, 指令/选项 192; OpenJev · DeBERTa: 状态 256, 请求 512; Kev-0.8B: 状态 512, 分支(包含状态)2,048。 全评估群体的指令/选项缩短次数(不能把各任务图表相加):Laya · 原生 0/2,000。这些计数与上方的状态截断次数分开。
在预留的 CLINC 请求集中,Reflex-1 正确处理 3,680/4,490 个意图与范围外请求(82.0%)。陌生工具选择为 72/87,低于外部模型的最佳结果 82/87。下方同时展示优势与差距。
意图路由
2026 年 10 月 3 日 · 开发快照 70a843878214已知与陌生请求
- Reflex-13,680/4,490 正确 · 0 次错误 · 0 次状态截断 · 64 次误拒 · 370 次误接受 82.0%95% 置信区间 80.8–83.1%
- Laya · native1,425/4,490 正确 · 0 次错误 · 0 次状态截断 · 0 次误拒 · 942 次误接受 31.7%95% 置信区间 30.3–33.2%
- Laya · 扩展版1,017/4,490 正确 · 0 次错误 · 0 次状态截断 · 0 次误拒 · 942 次误接受 22.7%95% 置信区间 21.4–23.9%
- OpenJev · DeBERTa2,496/4,490 正确 · 0 次错误 · 0 次状态截断 · 5 次误拒 · 939 次误接受 55.6%95% 置信区间 54.1–57.0%
- Kev-0.8B2,298/4,490 正确 · 0 次错误 · 0 次状态截断 · 1 次误拒 · 937 次误接受 51.2%95% 置信区间 49.6–52.6%
此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 4,490 个预留请求:3,548 个已知意图请求与 942 个范围外请求。同时展示原生 Laya 与单独声明的扩展上下文对照。 词元上限:Reflex-1: 状态 1,024, 请求 4,096; Laya · 原生: 请求 512, 指令/选项 192; Laya · 扩展: 请求 2,048, 指令/选项 1,536; OpenJev · DeBERTa: 状态 256, 请求 512; Kev-0.8B: 状态 512, 分支(包含状态)2,048。 全评估群体的指令/选项缩短次数(不能把各任务图表相加):Laya · 原生 4,490/4,490;Laya · 扩展 0/4,490。这些计数与上方的状态截断次数分开。
陌生工具选择
2026 年 10 月 3 日 · 开发快照 70a843878214工具选择
- Reflex-172/87 正确 · 0 次错误 · 0 次状态截断 82.8%95% 置信区间 74.7–90.8%
- Laya · native80/87 正确 · 0 次错误 · 14 次状态截断 92.0%95% 置信区间 86.2–97.7%
- Laya · 扩展版80/87 正确 · 0 次错误 · 0 次状态截断 92.0%95% 置信区间 86.2–97.7%
- OpenJev · DeBERTa82/87 正确 · 0 次错误 · 30 次状态截断 94.3%95% 置信区间 88.5–98.9%
- Kev-0.8B81/87 正确 · 0 次错误 · 1 次状态截断 93.1%95% 置信区间 87.4–97.7%
此处 Reflex-1 指所展示的 10 月 3 日开发权重,并非默认下载或最终版本。 87 个预留请求,其工具名称与规范化状态在训练前分离。这是工具选择适配,不涉及参数生成或执行。 词元上限:Reflex-1: 状态 1,024, 请求 4,096; Laya · 原生: 请求 512, 指令/选项 192; Laya · 扩展: 请求 2,048, 指令/选项 1,536; OpenJev · DeBERTa: 状态 256, 请求 512; Kev-0.8B: 状态 512, 分支(包含状态)2,048。 全评估群体的指令/选项缩短次数(不能把各任务图表相加):Laya · 原生 87/87;Laya · 扩展 65/87。这些计数与上方的状态截断次数分开。
这些是使用已声明评估群体的统一选项适配,并非官方排行榜提交。外部模型按原发布版本评估,未接受 Reflex-1 的任务专项训练。图表保留原始不确定性区间、词元预算和截断计数。
速度与资源
本节测量对应 10 月 2 日的检查点。当前检查点的测量可在上方链接的模型卡中查看。
H200 请求延迟
我们在共享的 NVIDIA H200 上为每个型号重播了 120 个不同的请求。 它们来自五个游戏和浏览器环境。每个模型都收到 相同的输入,一次只能发出一个请求。
H200 请求延迟
120 次输入·两次重复·一个请求正在运行- Reflex-1FP32 27.5 / 30.5
- OpenJevFP32 32.0 / 33.8
- Laya(原生)BF16 27.1 / 142.0
- Laya(FP32 重播)FP32 40.2 / 44.4
点:中位数。行尾:p95。包括令牌化、评分和环回 HTTP;不包括加载和预热。
完整的测量表和协议
| 模型 | 计算资源 | 中位数 | p95 |
|---|---|---|---|
| reflex-1 | FP32 | 27.5 | 30.5 |
| OpenJev | FP32 | 32.0 | 33.8 |
| Laya(原生) | BF16 | 27.1 | 142.0 |
| Laya(FP32 重播) | FP32 | 40.2 | 44.4 |
Laya原生使用BF16自动播放;还包括单独的FP32重播。OpenJev 是 DeBerta 的公共检查点,而不是托管的 Jev。这些请求时间不能衡量任务成功率或并发吞吐量。录制于 2026-09-29。
reflex-1 的延迟中位数为 27.5 ms,p95 为 30.5 ms。它快于 FP32 下的 OpenJev,也快于另一次 FP32 回放中的 Laya。Laya 原生配置使用 BF16 autocast,中位数略低。由于使用共享机器且样本有限,不能对接近的结果作过度推断。
计时器包括标记化、模型评分、输出标准化和环 回 HTTP。它不包括加载和三个预热请求。答案和 选项缓存已禁用。在这次运行中,我们没有测量并发服务 吞吐量。这里的 OpenJev 是 DeBerta 的公共检查点; 它不是托管的 Jev 服务。
M4 CPU 延迟
CPU 测试使用了 MacBook Air M4、FP32 和批量大小 1。每个模型使用 一个 PyTorch 操作内线程、一个操作间线程和一个 BLAS 线程限制。 每项任务有 24 个不同的案例,每个案例重复 两次。模型顺序在八个执行块中进行了平衡。
M4 CPU 请求延迟
FP32 · 第一批·PyTorch 线程 1/1 · BLAS 限制 1Banking77
- Reflex-1 345.2 / 692.0
- OpenJev 1,332.6 / 2,857.1
- Laya 912.4 / 2,649.9
- Kev 4,283.4 / 11,073.7
Emotion
- Reflex-1 256.2 / 610.4
- OpenJev 381.8 / 1,029.5
- Laya 240.1 / 427.7
- Kev 1,121.9 / 4,422.3
AG News
- Reflex-1 321.7 / 578.7
- OpenJev 424.5 / 934.0
- Laya 324.1 / 760.5
- Kev 1,356.5 / 4,997.2
SST-5
- Reflex-1 299.1 / 631.0
- OpenJev 360.5 / 894.5
- Laya 250.7 / 548.5
- Kev 902.2 / 4,480.5
BoolQ
- Reflex-1 463.4 / 1,329.1
- OpenJev 451.9 / 1,398.9
- Laya 440.4 / 1,587.9
- Kev 1,775.3 / 6,548.0
点表示中位数,线段末端表示 p95。所有任务使用同一对数刻度。内存:单独的 Reflex-1 回放测得峰值进程 RSS 为 1.50 GiB;本次比较未逐个测量各模型的内存。
完整的测量表和协议
| 任务 | reflex-1 | OpenJev | Laya | Kev |
|---|---|---|---|---|
| Banking77 | 345.2/ 692.0 | 1332.6/ 2857.1 | 912.4/ 2649.9 | 4283.4/ 11073.7 |
| Emotion | 256.2/ 610.4 | 381.8/ 1029.5 | 240.1/ 427.7 | 1121.9/ 4422.3 |
| AG News | 321.7/ 578.7 | 424.5/ 934.0 | 324.1/ 760.5 | 1356.5/ 4997.2 |
| SST-5 | 299.1/ 631.0 | 360.5/ 894.5 | 250.7/ 548.5 | 902.2/ 4480.5 |
| BoolQ | 463.4/ 1329.1 | 451.9/ 1398.9 | 440.4/ 1587.9 | 1775.3/ 6548.0 |
原生运行时预算。Laya按其原有预算截断了Banking77的期权;扩大的预算结果将单独报告。Kev 使用其 CPU 参考内核和未合并的适配器。录制于 2026-09-24。
Reflex-1 实测内存:1.50 GiB 峰值进程 RSS。对最初的120个输入进行单独的Reflex-1资源回放,每个输入都得分两次。全过程峰值 RSS 包括导入、模型加载、预热和推理。最初的四种模型延迟比较没有记录每个模型的内存。录制于 2026-10-02 UTC。资源测量和协议。
Banking77 要求模型从 77 种意图中选择。reflex-1 的延迟中位数为 345.2 ms,同一次测试中 OpenJev 为 1,332.6 ms。五项任务中,reflex-1 的中位数在 256.2 至 463.4 ms 之间。
Laya 完成了几项小选择的任务,速度更快。其原生Banking77预算截断了期权,因此其时机涵盖了缩减的候选组合。 Kev 使用了带有未合并适配器的 CPU 参考内核。后台 笔记本电脑活动导致尾部延迟扩大。
本测试在模型已加载的条件下,计时从构建请求到返回规范化输出的全过程。CPU 和 GPU 测试使用不同的请求,不能根据这些时间直接计算 CPU 到 GPU 的加速比。
熟悉任务的准确率
reflex-1在Banking77的得分为95.0%,在Emotion上得分为92.2%。它在两个 检查点的比较中均处于领先地位,在AG News和SST-5 上并列最佳分数,在BoolQ上的得分 略低于OpenJev。SST-5
决策准确性
每项任务 500 个示例·开发诊断Banking77
- Reflex-1 95.0%
- OpenJev 90.6%
- Laya · native 44.4%
- Laya · 扩展版 55.4%
- Kev 82.4%
Emotion
- Reflex-1 92.2%
- OpenJev 53.0%
- Laya · native 57.6%
- Laya · 扩展版 57.6%
- Kev 54.4%
AG News
- Reflex-1 91.2%
- OpenJev 77.4%
- Laya · native 91.2%
- Laya · 扩展版 91.2%
- Kev 87.2%
SST-5
- Reflex-1 59.8%
- OpenJev 59.8%
- Laya · native 51.0%
- Laya · 扩展版 51.0%
- Kev 55.2%
BoolQ
- Reflex-1 86.0%
- OpenJev 86.8%
- Laya · native 71.2%
- Laya · 扩展版 71.2%
- Kev 82.6%
任务组已纳入训练,在开发过程中对这些子集进行了检查。训练数据接触情况因模型而异。Laya的原生预算减少了Banking77的期权。
完整的测量表和协议
| 任务 | reflex-1 | Laya,本地人 | Laya,已扩展 | OpenJev | Kev |
|---|---|---|---|---|---|
| Banking77 | 95.0 | 44.4 | 55.4 | 90.6 | 82.4 |
| Emotion | 92.2 | 57.6 | 57.6 | 53.0 | 54.4 |
| AG News | 91.2 | 91.2 | 91.2 | 77.4 | 87.2 |
| SST-5 | 59.8 | 51.0 | 51.0 | 59.8 | 55.2 |
| BoolQ | 86.0 | 71.2 | 71.2 | 86.8 | 82.6 |
Laya SDK 0.3.20 显示的是原生代币预算和扩展代币预算。原生 Banking77 预算截断了选项集;扩展后的预算保留了所有 77 个标签。这些是开发诊断,不是独立的转移评估。
这些是每项任务的 500 个诊断示例。任务系列已包含 在训练中,我们在开发过程中检查了子集。不同模型的训练 预算和先前的曝光量有所不同。在更多示例中,精度与延迟是 分开测量的。
通用检查点使用我们的定制 浏览器控制器完成了 80 次试验中的 0 次。结果暴露了熟悉任务 分类和自主控制之间的巨大差距。转到不熟悉的问题 ,概率校准仍然是未解决的评估问题。
训练和存储
合并适配器后,服务模型有 420,778,370 个参数。 ModernBERT对状态和问题进行编码;冻结的 MiniLM 编码器代表选择。 共同的头像组合了他们的表现形式。
| 资源 | 已录制的配置 |
|---|---|
| 服务参数 | 420,778,370 |
| 在适应中训练的参数 | 9,036,290 |
| 适配硬件 | 1 × NVIDIA H200 |
| 主跑 | 6,000 次更新·75 分 7 秒 |
| 在磁盘上提取的 FP32 模型 | ≈ 1.69 GB |
| 测得的 CPU 进程内存 | 1.50 GiB 峰值 RSS · 单独回放 240 个请求 |
| CPU 计算线程 | PyTorch 操作内/互操作 1/1 · BLAS 限制 1 |
主要改编运行使用了来自八个任务系列的290,657条记录,在6,000个步骤中更新了9,036,290个参数。 在一个 H200 上花了 75 分 7 秒,包括开发屏幕和检查点保存。基础模型 预训练、数据准备、投影拟合和早期实验 是额外的成本。
解压后的 FP32 模型在磁盘上约占 1.69 GB。单独的 CPU 资源回放测得峰值进程 RSS 为 1.50 GiB,涵盖框架分配、分词器、加载、预热和推理。GPU 内存占用尚未测量。
模型访问权限
Hugging Face 的公开 版本包含 1.68 GB 的 FP32 权重、两个代币生成器和 Apache 2.0 下的自成 一体 Transformers 实现。无需账户、API 密钥或 GitHub 访问权限。使用 Python 3.12:
python -m pip install "torch==2.8.0" "transformers==5.17.0" "safetensors==0.8.0"
import torch
from transformers import AutoModel
torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)
decision = model.predict(
state="The customer was charged twice for one card payment.",
question="Choose the matching issue.",
options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)
加载模型一次即可重复使用。模型卡记录了批量推理、 多个问题、离线加载和发布哈希值。开发 仓库保持私有状态;公共包包含推理 所需的代码。
原始训练使用了 RACE 和 SciQ,其来源条款包含非商业使用限制。模型卡记录了使用情况和固定版本。来源审查并未确定这些条款如何适用于训练后的权重。
录屏与复现
使用 Hub 上十月 3 日的固定版本复现这些录像。上方图表保留了测得的结果,包括原有能力的退化。每段录像均说明环境、输入格式和播放速度。
当前版本的模型卡链接到单独的评估。这些录像和研究保留其原始结果。
也在研究中
Samsara-VLA
两个用于语言条件操作的紧凑机器人策略。观看它们抓取、放置、打开并完成多步骤任务。
VIO-lens-2
研究进行中。