[↖ 研究日誌](https://www.goodailabs.com/zh-tw/blog/) 公告 2026年10月5日 決策模型 # Reflex-1 簡介 具備 421M 參數的模型,用於工具路由、意圖分類與動作選擇,提供公開權重與實測 CPU 效能。 Good AI Labs 閱讀 · 5 分鐘 [模型與評估 ↗](https://www.goodailabs.com/zh-tw/research/reflex-1/) [權重和程式碼 ↗](https://huggingface.co/gai-labs/reflex-1)[發布結果 ↗](https://www.goodailabs.com/zh-tw/research/reflex-1/#current-results) Reflex-1 · 原版 Chromium43.6 秒 · 無聲影片 [觀看 Reflex-1 · Chromium Dino (MP4)](https://www.goodailabs.com/media/reflex-1/preview/chromium-dino-002-clean.mp4). Reflex-1 · Chromium Dino. Reflex-1 在原版 Chromium Dino 遊戲中使用引擎可見幾何資訊的結構化輸入。這是 2026 年 10 月 3 日開發快照。獨立賽道的完整錄屏在 42.309 秒發生碰撞時結束(得分 535),未完成 60 秒時限。推理期間瀏覽器持續執行。 正常速度的瀏覽器錄屏;推理期間遊戲時鐘持續執行。 在這篇文章中[該模型](https://www.goodailabs.com/#one-pass-many-possible-decisions)[示例](https://www.goodailabs.com/#recorded-examples)[CPU 推論](https://www.goodailabs.com/#cpu-inference)[試用 Reflex-1](https://www.goodailabs.com/#try-reflex-1) ## 一次透過,許多可能的決定 Reflex-1 是一個參數量為 421M 的模型,用於從候選項中做出決策。輸入文字狀態、問題及候選答案,模型即可透過一次前向傳播為候選項評分。每次請求都可以提供不同的候選項。 同一介面可用於分流支援請求、選擇工具或決定動作。28 層上下文編碼器和六層候選編碼器連接至共用評分頭。應用程式提供候選項並執行結果。 Reflex-1/決策模型 ### 從問題到選擇。 - 01 / 輸入 #### 定義決策。 您的應用程式提供了狀態、問題及其可以據以採取行動的選擇。這些選擇可能會隨著每個請求而改變:支援佇列、可用工具或允許的操作。 狀態 + 問題 客戶被收取了兩次費用。 哪個問題匹配? 重複收費丟失的卡未知費用現金提取 ↓ 背景 + 問題ModernBERT 每種選擇MiniLM ↓ 共享得分頭選擇機率 ↓ 應用程式許可權 → 論點 → 操作 說明性支援請求。應用程式定義候選集合。 - 02 / 編碼 #### 代表背景和候選人。 經過改編的ModernBERT編碼器可以讀取狀態和問題。凍結的 MiniLM 編碼器代表每個提供的選項。幾個問題可以共享一個擁擠的狀態。 狀態 + 問題 客戶被收取了兩次費用。 哪個問題匹配? 重複收費丟失的卡未知費用現金提取 ↓ 背景 + 問題ModernBERT 每種選擇MiniLM ↓ 共享得分頭選擇機率 ↓ 應用程式許可權 → 論點 → 操作 兩個編碼器為一個共享的計分頭供電。這是預覽架構的示意圖。 - 03 / 評分 #### 在一輪比賽中為所有提供的選項打分。 共享頭部將上下文和候選表示形式組合在一起,然後返回所提供選擇的機率分佈。新的決策型別仍然需要準確性和校準測試。 狀態 + 問題 客戶被收取了兩次費用。 哪個問題匹配? 重複收費丟失的卡未知費用現金提取 ↓ 背景 + 問題ModernBERT 每種選擇MiniLM ↓ 共享得分頭選擇機率 ↓ 應用程式許可權 → 論點 → 操作 每個提供的候選人一個分數,歸一化為機率分佈。 - 04 / 行動 #### 讓應用程式執行決定。 應用程式決定允許哪些操作,構造任何工具引數並執行所選操作。Reflex-1提供分數;周圍的系統擁有控制迴路。 狀態 + 問題 客戶被收取了兩次費用。 哪個問題匹配? 重複收費丟失的卡未知費用現金提取 ↓ 背景 + 問題ModernBERT 每種選擇MiniLM ↓ 共享得分頭選擇機率 ↓ 應用程式許可權 → 論點 → 操作 應用程式邊界很重要:對工具進行評分並不能執行該工具。 公共開發預覽版的架構。支援請求說明了輸入格式。 ## 錄影範例 上方的 Dino 錄影與下方範例使用 [10 月 3 日快照](https://huggingface.co/gai-labs/reflex-1/tree/ae50bf81cddcaaac2aa18021d862433ca69da197),與預設公開權重不同。執行條件與結果皆列於影片說明中。 Reflex-1 · 原生 ViZDoom36.5 秒 · 無聲影片 [觀看 Reflex-1 · ViZDoom (MP4)](https://www.goodailabs.com/media/reflex-1/preview/vizdoom-510001-clean.mp4). Reflex-1 · ViZDoom. Reflex-1 在原生 ViZDoom 1.3.1 的 Defend the Center 場景中執行,難度為 5。2026 年 10 月 3 日開發快照;預先指定的錄製種子為 510001。完整回合在規定 45 秒模擬時間中的 34.514 秒時死亡結束,擊殺 30 個敵人。模型接收引擎可見標籤與生命值/彈藥量,不接收畫素。播放遵循錄製的模擬時間,不包含推理延遲。 按模擬時間播放,不包含推理延遲;保留原始終止畫面的停留時間。 Reflex-1 · 合成 WebGym30.1 秒 · 4× · 無聲影片 [觀看 餐廳預訂 · 任務完成 (MP4)](https://www.goodailabs.com/media/reflex-1/preview/webgym-restaurant-960000-clean.mp4). 餐廳預訂 · 任務完成. 10 月 3 日開發快照;15 個動作。在 Chromium 中捕獲瀏覽器狀態,以實際時間的 4× 速度回放,保留完整結局與終止畫面的停留。 本地合成任務,共用 Qwen3-1.7B 文字輔助模型。該快照與 Hub 預設權重不同。 [查看全部錄影與比較](https://www.goodailabs.com/zh-tw/research/reflex-1/#examples)。 ## CPU 推論 目前檢查點在 Intel Xeon Platinum 8558 CPU 上以 FP32 測量,每次處理一個請求。每種執行緒設定在兩個新程序中對 120 個輸入共執行 480 次呼叫。計時包含斷詞與推論。 目前的 CPU 測量結果 Intel Xeon Platinum 8558 · FP32 · 批次大小 1 一個運算執行緒 延遲 · 越低越快中位數/p95 - AG News 1209.7 / 1385.0 ms - SST-5 973.6 / 1160.3 ms - Emotion 956.9 / 1165.8 ms - Banking77 1101.7 / 1276.9 ms - BoolQ 1600.8 / 2710.6 ms 01,5003,000 ms 四個運算執行緒 延遲 · 越低越快中位數/p95 - AG News 389.5 / 480.4 ms - SST-5 320.6 / 404.2 ms - Emotion 318.8 / 391.0 ms - Banking77 375.2 / 452.1 ms - BoolQ 486.7 / 782.2 ms 01,5003,000 ms 每種執行緒設定在兩個新程序中,對 120 個輸入執行 480 次呼叫。計時包含斷詞與推論,不含載入與暖機。使用共用主機與評估執行環境,不使用跨請求快取。 程序尖峰記憶體為 2.17 GiB,包括載入、預熱與推論。測試分別使用一個或四個 PyTorch 算子內執行緒、一個算子間執行緒,以及相同數量的 BLAS 執行緒。觀測到的作業系統執行緒總數分別為兩個和十一個,其中包含執行環境的輔助執行緒。 [目前的測量與評估](https://huggingface.co/gai-labs/reflex-1/blob/84c2cd49d31f73544e1e17539092056e741e7f03/evaluation.json)。這些共用主機上的計時使用評估執行環境,不包含載入、暖機與跨請求快取。研究頁面保留了[早期 M4 與 H200 測量結果](https://www.goodailabs.com/zh-tw/research/reflex-1/#speed-and-resources)及其檢查點日期。 ## 試用 Reflex-1 公開權重、分詞器及推論程式碼均已發布於 [Hugging Face](https://huggingface.co/gai-labs/reflex-1)。無須帳號或 API 金鑰。安裝相依套件後即可執行: ``` import torch from transformers import AutoModel torch.set_num_threads(1) model = AutoModel.from_pretrained("gai-labs/reflex-1", trust_remote_code=True) decision = model.predict( state="The customer was charged twice for one card payment.", question="Choose the matching issue.", options=["duplicate charge", "lost card", "unknown fee", "cash withdrawal"], )[0] print(decision.choice) ``` 安裝方式、執行階段限制及授權資訊(包括訓練資料來源的使用條款)詳見[模型卡](https://huggingface.co/gai-labs/reflex-1)。 [型號詳情 ## Reflex-1 具備 421M 參數的模型,用於工具路由、意圖分類與動作選擇。權重公開,可在 CPU 或 GPU 上執行。 ↗](https://www.goodailabs.com/zh-tw/research/reflex-1/) [來自實驗室的更多內容 ↗](https://www.goodailabs.com/zh-tw/blog/)