[↖ 研究日志](https://www.goodailabs.com/zh-cn/blog/) 公告 2026年10月5日 决策模型 # Reflex-1 简介 具有 421M 参数的模型,用于工具路由、意图分类和动作选择,提供公开权重和实测 CPU 性能。 Good AI Labs 阅读 · 5 分钟 [模型与评估 ↗](https://www.goodailabs.com/zh-cn/research/reflex-1/) [权重和代码 ↗](https://huggingface.co/gai-labs/reflex-1)[发布结果 ↗](https://www.goodailabs.com/zh-cn/research/reflex-1/#current-results) Reflex-1 · 原版 Chromium43.6 秒 · 无声视频 [观看 Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-002-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 游戏中使用引擎可见几何信息的结构化输入。这是 2026 年 10 月 3 日开发快照。独立赛道的完整录屏在 42.309 秒发生碰撞时结束(得分 535),未完成 60 秒时限。推理期间浏览器持续运行。 正常速度的浏览器录屏;推理期间游戏时钟持续运行。 在这篇文章中[该模型](https://www.goodailabs.com/#one-pass-many-possible-decisions)[示例](https://www.goodailabs.com/#recorded-examples)[CPU 推理](https://www.goodailabs.com/#cpu-inference)[试用 Reflex-1](https://www.goodailabs.com/#try-reflex-1) ## 一次通过,许多可能的决定 Reflex-1 是一个参数量为 421M 的模型,用于从候选项中作出决策。输入文本状态、问题及候选答案,模型即可通过一次前向传播为候选项评分。每次请求都可以提供不同的候选项。 同一接口可用于分流支持请求、选择工具或决定动作。28 层上下文编码器和六层候选编码器连接到共享评分头。应用提供候选项并执行结果。 Reflex-1/决策模型 ### 从问题到选择。 - 01 / 输入 #### 定义决策。 您的应用程序提供了状态、问题及其可以据以采取行动的选择。这些选择可能会随着每个请求而改变:支持队列、可用工具或允许的操作。 状态 + 问题 客户被收取了两次费用。 哪个问题匹配? 重复收费丢失的卡未知费用现金提取 ↓ 背景 + 问题ModernBERT 每种选择MiniLM ↓ 共享得分头选择概率 ↓ 应用程序权限 → 论点 → 操作 说明性支持请求。应用程序定义候选集合。 - 02 / 编码 #### 代表背景和候选人。 经过改编的ModernBERT编码器可以读取状态和问题。冻结的 MiniLM 编码器代表每个提供的选项。几个问题可以共享一个拥挤的状态。 状态 + 问题 客户被收取了两次费用。 哪个问题匹配? 重复收费丢失的卡未知费用现金提取 ↓ 背景 + 问题ModernBERT 每种选择MiniLM ↓ 共享得分头选择概率 ↓ 应用程序权限 → 论点 → 操作 两个编码器为一个共享的计分头供电。这是预览架构的示意图。 - 03 / 评分 #### 在一轮比赛中为所有提供的选项打分。 共享头部将上下文和候选表示形式组合在一起,然后返回所提供选择的概率分布。新的决策类型仍然需要准确性和校准测试。 状态 + 问题 客户被收取了两次费用。 哪个问题匹配? 重复收费丢失的卡未知费用现金提取 ↓ 背景 + 问题ModernBERT 每种选择MiniLM ↓ 共享得分头选择概率 ↓ 应用程序权限 → 论点 → 操作 每个提供的候选人一个分数,归一化为概率分布。 - 04 / 行动 #### 让应用程序执行决定。 应用程序决定允许哪些操作,构造任何工具参数并执行所选操作。Reflex-1提供分数;周围的系统拥有控制回路。 状态 + 问题 客户被收取了两次费用。 哪个问题匹配? 重复收费丢失的卡未知费用现金提取 ↓ 背景 + 问题ModernBERT 每种选择MiniLM ↓ 共享得分头选择概率 ↓ 应用程序权限 → 论点 → 操作 应用程序边界很重要:对工具进行评分并不能执行该工具。 公共开发预览版的架构。支持请求说明了输入格式。 ## 录像示例 上方的 Dino 录像和下方示例使用 [10 月 3 日快照](https://huggingface.co/gai-labs/reflex-1/tree/ae50bf81cddcaaac2aa18021d862433ca69da197),与默认公开权重不同。运行条件和结果均列在视频说明中。 Reflex-1 · 原生 ViZDoom36.5 秒 · 无声视频 [观看 Reflex-1 · ViZDoom (MP4)](https://www.goodailabs.com/media/reflex-1/preview/vizdoom-510001-clean.mp4). Reflex-1 · ViZDoom. Reflex-1 在原生 ViZDoom 1.3.1 的 Defend the Center 场景中运行,难度为 5。2026 年 10 月 3 日开发快照;预先指定的录制种子为 510001。完整回合在规定 45 秒模拟时间中的 34.514 秒时死亡结束,击杀 30 个敌人。模型接收引擎可见标签与生命值/弹药量,不接收像素。播放遵循录制的模拟时间,不包含推理延迟。 按模拟时间播放,不包含推理延迟;保留原始终止画面的停留时间。 Reflex-1 · 合成 WebGym30.1 秒 · 4× · 无声视频 [观看 餐厅预订 · 任务完成 (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-restaurant-960000-clean.mp4). 餐厅预订 · 任务完成. 10 月 3 日开发快照;15 个动作。在 Chromium 中捕获浏览器状态,以实际时间的 4× 速度回放,保留完整结局与终止画面的停留。 本地合成任务,共用 Qwen3-1.7B 文本辅助模型。该快照与 Hub 默认权重不同。 [查看全部录像与对比](https://www.goodailabs.com/zh-cn/research/reflex-1/#examples)。 ## CPU 推理 当前检查点在 Intel Xeon Platinum 8558 CPU 上以 FP32 测量,每次处理一个请求。每种线程设置在两个新进程中对 120 个输入共执行 480 次调用。计时包括分词和推理。 当前 CPU 测量结果 Intel Xeon Platinum 8558 · FP32 · 批大小 1 一个计算线程 延迟 · 越低越快中位数/p95 - AG News 1209.7 / 1385.0 ms - SST-5 973.6 / 1160.3 ms - Emotion 956.9 / 1165.8 ms - Banking77 1101.7 / 1276.9 ms - BoolQ 1600.8 / 2710.6 ms 01,5003,000 ms 四个计算线程 延迟 · 越低越快中位数/p95 - AG News 389.5 / 480.4 ms - SST-5 320.6 / 404.2 ms - Emotion 318.8 / 391.0 ms - Banking77 375.2 / 452.1 ms - BoolQ 486.7 / 782.2 ms 01,5003,000 ms 每种线程配置在两个新进程中对 120 个输入执行 480 次调用。计时包括分词和推理,不包括加载和预热。使用共享主机和评估运行时,不使用跨请求缓存。 进程峰值内存为 2.17 GiB,包括加载、预热和推理。测试分别使用一个或四个 PyTorch 算子内线程、一个算子间线程,以及相同数量的 BLAS 线程。观测到的操作系统线程总数分别为两个和十一个,其中包含运行时辅助线程。 [当前测量与评估](https://huggingface.co/gai-labs/reflex-1/blob/84c2cd49d31f73544e1e17539092056e741e7f03/evaluation.json)。这些共享主机上的计时使用评估运行时,不包括加载、预热和跨请求缓存。研究页面保留了[早期 M4 和 H200 测量结果](https://www.goodailabs.com/zh-cn/research/reflex-1/#speed-and-resources)及其检查点日期。 ## 试用 Reflex-1 公开权重、分词器和推理代码均已发布在 [Hugging Face](https://huggingface.co/gai-labs/reflex-1)。无需账户或 API 密钥。安装依赖后即可运行: ``` import torch from transformers import AutoModel torch.set_num_threads(1) model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True) decision = model.predict( state="The customer was charged twice for one card payment.", question="Choose the matching issue.", options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"], )[0] print(decision.choice) ``` 安装方法、运行时限制及许可信息(包括训练数据来源的使用条款)详见[模型卡](https://huggingface.co/gai-labs/reflex-1)。 [型号详情 ## Reflex-1 具有 421M 参数的模型,用于工具路由、意图分类和动作选择。权重公开,可在 CPU 或 GPU 上运行。 ↗](https://www.goodailabs.com/zh-cn/research/reflex-1/) [来自实验室的更多内容 ↗](https://www.goodailabs.com/zh-cn/blog/)