モデルエンジニアリング
421M モデル内の 9M パラメーターの適合
reflex-1 メインアダプテーションは、1台のH200で75分かかりました。トレーニング可能なパラメータがどこにあるのか、そのタイミングには何が含まれるのか。
reflex-1 の主要な適応学習では、9,036,290 個のパラメーターを更新しました。アダプターの統合後、推論モデルのパラメーター数は 420,778,370 でした。更新対象は推論モデル全体の約 2.15% です。
大部分のパラメーターは事前学習済みのエンコーダーに由来します。ModernBERT が状態と質問を表現し、凍結した MiniLM が回答候補を表現します。学習した射影が両者を接続します。主要な学習では、ランク 16 のアダプターと共有の意思決定ヘッドを更新しました。
凍結されたウェイトは引き続き推論の対象となります。適応しても更新されなくても 、メモリを占有して計算を実行します。
計測ラン数
8つのタスクファミリーの290,657件のレコードを使用し、6,000件の更新を実行しました。 開発画面とチェックポイント保存を含めて、1 台の NVIDIA H200 でのループは 75 分 7 秒かかりました。
このタイミングには、ベースモデルの事前トレーニング、ダウンロード、データ準備、 予測フィッティング、および以前の実験は含まれません。この実行により、使い慣れたタスク診断で、Banking77の精度が95.0%、Emotion 精度が92.2%のチェックポイントが得られました。 パフォーマンスレポートには、5 つのタスクすべてと比較されたチェックポイントが含まれます。
マージ後
抽出された FP32 モデルのディスク容量は約 1.69 GB です。サービングには、 アクティベーションとフレームワーク割り当て用のメモリがまだ必要です。 したがって、アダプターの割合はアダプテーションジョブを表し、 実行時に必要なモデル全体の割合を表すものではありません。