简
联系
菜单
研究日志

公告

决策模型

Reflex-1 简介

具有 421M 参数的模型,用于工具路由、意图分类和动作选择,提供公开权重和实测 CPU 性能。

Good AI Labs 阅读 5 分钟

Reflex-1 · 原版 Chromium43.6 秒 无声视频
Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 游戏中使用引擎可见几何信息的结构化输入。这是 2026 年 10 月 3 日开发快照。独立赛道的完整录屏在 42.309 秒发生碰撞时结束(得分 535),未完成 60 秒时限。推理期间浏览器持续运行。 正常速度的浏览器录屏;推理期间游戏时钟持续运行。

一次通过,许多可能的决定

Reflex-1 是一个参数量为 421M 的模型,用于从候选项中作出决策。输入文本状态、问题及候选答案,模型即可通过一次前向传播为候选项评分。每次请求都可以提供不同的候选项。

同一接口可用于分流支持请求、选择工具或决定动作。28 层上下文编码器和六层候选编码器连接到共享评分头。应用提供候选项并执行结果。

Reflex-1/决策模型

从问题到选择。

  1. 01 / 输入

    定义决策。

    您的应用程序提供了状态、问题及其可以据以采取行动的选择。这些选择可能会随着每个请求而改变:支持队列、可用工具或允许的操作。

    状态 + 问题

    客户被收取了两次费用。
    哪个问题匹配?

    重复收费丢失的卡未知费用现金提取
    背景 + 问题ModernBERT
    每种选择MiniLM
    共享得分头选择概率
    应用程序权限 → 论点 → 操作
    说明性支持请求。应用程序定义候选集合。
  2. 02 / 编码

    代表背景和候选人。

    经过改编的ModernBERT编码器可以读取状态和问题。冻结的 MiniLM 编码器代表每个提供的选项。几个问题可以共享一个拥挤的状态。

    状态 + 问题

    客户被收取了两次费用。
    哪个问题匹配?

    重复收费丢失的卡未知费用现金提取
    背景 + 问题ModernBERT
    每种选择MiniLM
    共享得分头选择概率
    应用程序权限 → 论点 → 操作
    两个编码器为一个共享的计分头供电。这是预览架构的示意图。
  3. 03 / 评分

    在一轮比赛中为所有提供的选项打分。

    共享头部将上下文和候选表示形式组合在一起,然后返回所提供选择的概率分布。新的决策类型仍然需要准确性和校准测试。

    状态 + 问题

    客户被收取了两次费用。
    哪个问题匹配?

    重复收费丢失的卡未知费用现金提取
    背景 + 问题ModernBERT
    每种选择MiniLM
    共享得分头选择概率
    应用程序权限 → 论点 → 操作
    每个提供的候选人一个分数,归一化为概率分布。
  4. 04 / 行动

    让应用程序执行决定。

    应用程序决定允许哪些操作,构造任何工具参数并执行所选操作。Reflex-1提供分数;周围的系统拥有控制回路。

    状态 + 问题

    客户被收取了两次费用。
    哪个问题匹配?

    重复收费丢失的卡未知费用现金提取
    背景 + 问题ModernBERT
    每种选择MiniLM
    共享得分头选择概率
    应用程序权限 → 论点 → 操作
    应用程序边界很重要:对工具进行评分并不能执行该工具。

公共开发预览版的架构。支持请求说明了输入格式。

录像示例

上方的 Dino 录像和下方示例使用 10 月 3 日快照,与默认公开权重不同。运行条件和结果均列在视频说明中。

Reflex-1 · 原生 ViZDoom36.5 秒 无声视频
Reflex-1 · ViZDoom. Reflex-1 在原生 ViZDoom 1.3.1 的 Defend the Center 场景中运行,难度为 5。2026 年 10 月 3 日开发快照;预先指定的录制种子为 510001。完整回合在规定 45 秒模拟时间中的 34.514 秒时死亡结束,击杀 30 个敌人。模型接收引擎可见标签与生命值/弹药量,不接收像素。播放遵循录制的模拟时间,不包含推理延迟。 按模拟时间播放,不包含推理延迟;保留原始终止画面的停留时间。
Reflex-1 · 合成 WebGym30.1 秒 · 4× 无声视频
餐厅预订 · 任务完成. 10 月 3 日开发快照;15 个动作。在 Chromium 中捕获浏览器状态,以实际时间的 4× 速度回放,保留完整结局与终止画面的停留。 本地合成任务,共用 Qwen3-1.7B 文本辅助模型。该快照与 Hub 默认权重不同。

查看全部录像与对比。

CPU 推理

当前检查点在 Intel Xeon Platinum 8558 CPU 上以 FP32 测量,每次处理一个请求。每种线程设置在两个新进程中对 120 个输入共执行 480 次调用。计时包括分词和推理。

当前 CPU 测量结果

Intel Xeon Platinum 8558 · FP32 · 批大小 1

一个计算线程

延迟 · 越低越快中位数/p95
  1. AG News 1209.7 / 1385.0 ms
  2. SST-5 973.6 / 1160.3 ms
  3. Emotion 956.9 / 1165.8 ms
  4. Banking77 1101.7 / 1276.9 ms
  5. BoolQ 1600.8 / 2710.6 ms

四个计算线程

延迟 · 越低越快中位数/p95
  1. AG News 389.5 / 480.4 ms
  2. SST-5 320.6 / 404.2 ms
  3. Emotion 318.8 / 391.0 ms
  4. Banking77 375.2 / 452.1 ms
  5. BoolQ 486.7 / 782.2 ms

每种线程配置在两个新进程中对 120 个输入执行 480 次调用。计时包括分词和推理,不包括加载和预热。使用共享主机和评估运行时,不使用跨请求缓存。

进程峰值内存为 2.17 GiB,包括加载、预热和推理。测试分别使用一个或四个 PyTorch 算子内线程、一个算子间线程,以及相同数量的 BLAS 线程。观测到的操作系统线程总数分别为两个和十一个,其中包含运行时辅助线程。

当前测量与评估。这些共享主机上的计时使用评估运行时,不包括加载、预热和跨请求缓存。研究页面保留了早期 M4 和 H200 测量结果及其检查点日期。

试用 Reflex-1

公开权重、分词器和推理代码均已发布在 Hugging Face。无需账户或 API 密钥。安装依赖后即可运行:

import torch
from transformers import AutoModel

torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)

decision = model.predict(
    state="The customer was charged twice for one card payment.",
    question="Choose the matching issue.",
    options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)

安装方法、运行时限制及许可信息(包括训练数据来源的使用条款)详见模型卡。

型号详情

Reflex-1

具有 421M 参数的模型,用于工具路由、意图分类和动作选择。权重公开,可在 CPU 或 GPU 上运行。