Multiverse Computing、境界認識型セーフティ蒸留手法「Safety for Whom?」を発表──政治トピックの過剰拒否を 4.16% へ抑制
トピック単位ではなく意図ごとの境界をデータセットで制御し、Qwen3-8B の政治的害悪拒否率 84.75% と健全プロンプトの過剰拒否抑制を両立させた。
リリース: 2026-09-08 · 読了 4 分記事の要約
1. 核心(What)
- Multiverse Computing の研究チームは、LLM のセーフティ調整においてトピック単位ではなく特定の境界(有害な意図と正当な意図)を制御する手法「Safety for Whom?」を論文発表した。
- Qwen3-8B に対する適用実験では、政治的プロンプトにおける害悪拒否率が従来の 9.47% から 84.75% へ向上した。
- 単純なセーフティ調整で発生する XSTest での過剰拒否(過剰反応)が最大 74.00% まで悪化する現象を確認し、境界ペアデータ追加によりこれを 4.16% まで抑制することに成功した。
- シングルショット生成で脱落していた 19.88%(8,009 件)の失敗プロンプトを段階的リトライ戦略(escalated retry)により 0.20%(79 件)まで削減し、40,293 件の訓練データを確保した。
2. 影響(Why)
- セーフティ調整のトレードオフ可視化: 有害なプロンプトの拒否率だけでなく、隣接する健全なプロンプトの過剰拒否率(偽陽性)を同時に計測しなければ、実運用で使い物にならない過剰拒否モデルを産むリスクを回避できない。
- 国内パブリックセクター・教育系 SaaS の実務設計への影響: 国内の公共・教育系 LLM アプリケーション開発ベンダー(中堅〜大手 SIer・AI ベンチャー)は、選挙や政治的話題のような微妙な境界線を持つ領域で、一律のトピック拒否ではなく意図ごとの厳密なガードレール設計へと評価軸を切り替える必要がある。
3. 根拠・詳細(How)
- 段階的リトライ戦略によるデータ網羅性の確保: 単一のステアリング試行で脱落するプロンプトに対し、段階的に強力なステアリングを適用する再サンプリング(escalated retry)を実行し、残存失敗率を 0.20% まで圧縮した。
- 境界ペアデータによる過剰拒否の抑制機構: トピックアンカーを共有し意図のみが異なる害悪・健全のペアデータ(1,539 ペア/側)を訓練に導入し、害悪側の拒否率(87.72% 維持)を落とさずに健全側の過剰拒否を 32.94% から 4.16% へ改善した。
4. 展望・課題(Next)
- 政治以外のトピックへの拡張検証: 政治トピックの実験で確立されたデータ構成パイプラインを、医療や金融など他のセンシティブなドメインへ展開する検証が予定されている。