模型工程
在 421M 模型中調整 9M引數
reflex-1 的主要改編執行在一個 H200 上花了 75 分鐘。可訓練引數的位置以及該時機包括的內容。
reflex-1 的主要適配訓練更新了 9,036,290 個引數。合併介面卡後,推理模型共有 420,778,370 個引數。訓練更新的引數約佔推理模型的 2.15%。
大多數引數來自預訓練編碼器。ModernBERT 表示狀態與問題;凍結的 MiniLM 表示候選答案。經過擬合的投影連線兩者的表示。主要訓練執行更新了秩為 16 的介面卡和一個共享決策頭。
凍結的權重仍參與推理。即使適應不更新它們,它們也會佔用記憶體 並執行計算。
測得的跑步次數
我們使用了來自八個任務系列的290,657條記錄,進行了6,000次更新。 在一臺NVIDIA H200上的迴圈歷時75分7秒,包括 開發螢幕和檢查點儲存。
該時間不包括基礎模型的預訓練、下載、資料準備、 投影擬合和早期實驗。這次執行產生的檢查點Banking77的 檢查點的準確率為95.0%,熟悉的任務診斷中的Emotion準確率為92.2%。 效能報告 涵蓋了所有五項任務和比較的檢查點。
合併後
提取的 FP32 模型在磁碟上佔用大約 1.69 GB 的空間。服務仍然需要 記憶體來啟用和框架分配。 因此,介面卡分數描述的是適配任務,而不是執行時 所需的完整模型的部分。