繁
聯絡
選單
研究日誌

公告

決策模型

Reflex-1 簡介

具備 421M 參數的模型,用於工具路由、意圖分類與動作選擇,提供公開權重與實測 CPU 效能。

Good AI Labs 閱讀 5 分鐘

Reflex-1 · 原版 Chromium43.6 秒 無聲影片
Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 遊戲中使用引擎可見幾何資訊的結構化輸入。這是 2026 年 10 月 3 日開發快照。獨立賽道的完整錄屏在 42.309 秒發生碰撞時結束(得分 535),未完成 60 秒時限。推理期間瀏覽器持續執行。 正常速度的瀏覽器錄屏;推理期間遊戲時鐘持續執行。

一次透過,許多可能的決定

Reflex-1 是一個參數量為 421M 的模型,用於從候選項中做出決策。輸入文字狀態、問題及候選答案,模型即可透過一次前向傳播為候選項評分。每次請求都可以提供不同的候選項。

同一介面可用於分流支援請求、選擇工具或決定動作。28 層上下文編碼器和六層候選編碼器連接至共用評分頭。應用程式提供候選項並執行結果。

Reflex-1/決策模型

從問題到選擇。

  1. 01 / 輸入

    定義決策。

    您的應用程式提供了狀態、問題及其可以據以採取行動的選擇。這些選擇可能會隨著每個請求而改變:支援佇列、可用工具或允許的操作。

    狀態 + 問題

    客戶被收取了兩次費用。
    哪個問題匹配?

    重複收費丟失的卡未知費用現金提取
    背景 + 問題ModernBERT
    每種選擇MiniLM
    共享得分頭選擇機率
    應用程式許可權 → 論點 → 操作
    說明性支援請求。應用程式定義候選集合。
  2. 02 / 編碼

    代表背景和候選人。

    經過改編的ModernBERT編碼器可以讀取狀態和問題。凍結的 MiniLM 編碼器代表每個提供的選項。幾個問題可以共享一個擁擠的狀態。

    狀態 + 問題

    客戶被收取了兩次費用。
    哪個問題匹配?

    重複收費丟失的卡未知費用現金提取
    背景 + 問題ModernBERT
    每種選擇MiniLM
    共享得分頭選擇機率
    應用程式許可權 → 論點 → 操作
    兩個編碼器為一個共享的計分頭供電。這是預覽架構的示意圖。
  3. 03 / 評分

    在一輪比賽中為所有提供的選項打分。

    共享頭部將上下文和候選表示形式組合在一起,然後返回所提供選擇的機率分佈。新的決策型別仍然需要準確性和校準測試。

    狀態 + 問題

    客戶被收取了兩次費用。
    哪個問題匹配?

    重複收費丟失的卡未知費用現金提取
    背景 + 問題ModernBERT
    每種選擇MiniLM
    共享得分頭選擇機率
    應用程式許可權 → 論點 → 操作
    每個提供的候選人一個分數,歸一化為機率分佈。
  4. 04 / 行動

    讓應用程式執行決定。

    應用程式決定允許哪些操作,構造任何工具引數並執行所選操作。Reflex-1提供分數;周圍的系統擁有控制迴路。

    狀態 + 問題

    客戶被收取了兩次費用。
    哪個問題匹配?

    重複收費丟失的卡未知費用現金提取
    背景 + 問題ModernBERT
    每種選擇MiniLM
    共享得分頭選擇機率
    應用程式許可權 → 論點 → 操作
    應用程式邊界很重要:對工具進行評分並不能執行該工具。

公共開發預覽版的架構。支援請求說明了輸入格式。

錄影範例

上方的 Dino 錄影與下方範例使用 10 月 3 日快照,與預設公開權重不同。執行條件與結果皆列於影片說明中。

Reflex-1 · 原生 ViZDoom36.5 秒 無聲影片
Reflex-1 · ViZDoom. Reflex-1 在原生 ViZDoom 1.3.1 的 Defend the Center 場景中執行,難度為 5。2026 年 10 月 3 日開發快照;預先指定的錄製種子為 510001。完整回合在規定 45 秒模擬時間中的 34.514 秒時死亡結束,擊殺 30 個敵人。模型接收引擎可見標籤與生命值/彈藥量,不接收畫素。播放遵循錄製的模擬時間,不包含推理延遲。 按模擬時間播放,不包含推理延遲;保留原始終止畫面的停留時間。
Reflex-1 · 合成 WebGym30.1 秒 · 4× 無聲影片
餐廳預訂 · 任務完成. 10 月 3 日開發快照;15 個動作。在 Chromium 中捕獲瀏覽器狀態,以實際時間的 4× 速度回放,保留完整結局與終止畫面的停留。 本地合成任務,共用 Qwen3-1.7B 文字輔助模型。該快照與 Hub 預設權重不同。

查看全部錄影與比較。

CPU 推論

目前檢查點在 Intel Xeon Platinum 8558 CPU 上以 FP32 測量,每次處理一個請求。每種執行緒設定在兩個新程序中對 120 個輸入共執行 480 次呼叫。計時包含斷詞與推論。

目前的 CPU 測量結果

Intel Xeon Platinum 8558 · FP32 · 批次大小 1

一個運算執行緒

延遲 · 越低越快中位數/p95
  1. AG News 1209.7 / 1385.0 ms
  2. SST-5 973.6 / 1160.3 ms
  3. Emotion 956.9 / 1165.8 ms
  4. Banking77 1101.7 / 1276.9 ms
  5. BoolQ 1600.8 / 2710.6 ms

四個運算執行緒

延遲 · 越低越快中位數/p95
  1. AG News 389.5 / 480.4 ms
  2. SST-5 320.6 / 404.2 ms
  3. Emotion 318.8 / 391.0 ms
  4. Banking77 375.2 / 452.1 ms
  5. BoolQ 486.7 / 782.2 ms

每種執行緒設定在兩個新程序中,對 120 個輸入執行 480 次呼叫。計時包含斷詞與推論,不含載入與暖機。使用共用主機與評估執行環境,不使用跨請求快取。

程序尖峰記憶體為 2.17 GiB,包括載入、預熱與推論。測試分別使用一個或四個 PyTorch 算子內執行緒、一個算子間執行緒,以及相同數量的 BLAS 執行緒。觀測到的作業系統執行緒總數分別為兩個和十一個,其中包含執行環境的輔助執行緒。

目前的測量與評估。這些共用主機上的計時使用評估執行環境,不包含載入、暖機與跨請求快取。研究頁面保留了早期 M4 與 H200 測量結果及其檢查點日期。

試用 Reflex-1

公開權重、分詞器及推論程式碼均已發布於 Hugging Face。無須帳號或 API 金鑰。安裝相依套件後即可執行:

import torch
from transformers import AutoModel

torch.set_num_threads(1)
model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True)

decision = model.predict(
    state="The customer was charged twice for one card payment.",
    question="Choose the matching issue.",
    options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"],
)[0]
print(decision.choice)

安裝方式、執行階段限制及授權資訊(包括訓練資料來源的使用條款)詳見模型卡。

型號詳情

Reflex-1

具備 421M 參數的模型,用於工具路由、意圖分類與動作選擇。權重公開,可在 CPU 或 GPU 上執行。