Goodfire、Silico プラットフォームを用いて強化学習のモード崩壊を重み直接編集で修復──繰り返しトークンの比率を 94% から 5% へ削減
再学習コストをかけずにモデルの重みを直接修正する Direct Logit Attribution 技術により、MMLU 低下を 3 ポイントに抑えつつ半日でモード崩壊を解消した。
リリース: 2026-07-28 · 読了 3 分記事の要約
1. 核心(What)
- Goodfire は Silico プラットフォームを利用し、強化学習のモード崩壊によって出力の 94% を占めていた繰り返しトークンを 5% まで削減した。
- Direct Logit Attribution 手法を活用し、特定のトークン確率を押し上げている原因となるモデルの重みを直接特定して編集した。
- MMLU ベンチマークの性能低下は 3 パーセントポイントにとどまり、副作用を最小限に抑えた外科的な修正を実現した。
- Silico は現在プライベートベータ版として提供されており、価格体系は個別対応となっている。
2. 影響(Why)
- 再学習コストの回避: 数千ドル規模の計算資源を費やしてデータセットを再キュレーションしゼロから再学習するコストを回避し、半日程度のハッカソン作業で崩壊モデルを即座に復旧できる。
- 国内LLM開発チームへの影響: 独自に強化学習(RL)を回している国内の生成AI開発ベンチャー(数人〜数十人規模のチーム)は、モード崩壊発生時のリカバリ工程において「全データ再学習」以外の安価な選択肢としてモデル直接編集を検証する価値がある。
3. 根拠・詳細(How)
- Direct Logit Attribution による要因特定: 各注意機構ヘッドや MLP 層といったニューラルネットワークの個別コンポーネントが特定のトークン予測をどれだけ後押ししているかをトレースし、ランク付けされた重みリストを取得する。
- 重みの直接編集: 特定された問題のある重みパラメータを直接下方修正することで、クリーンなデータの追加学習なしに偏った出力を抑制する。
4. 展望・課題(Next)
- 一般提供と価格体系の確定: 現在は個別対応のプライベートベータ版であり、今後一般向けのセルフサーブ展開や標準的なライセンス体系が公開されるかが焦点となる。