EleutherAI、AI の虚偽検出コンペティション Aletheia's Quest の振り返りを公開──27B〜120B モデルでの検証結果と知見
オープンウェイトモデル 3 ファミリーを用いたブラックボックスおよびホワイトボックス監視手法の有効性と限界を分析した。
リリース: 2026-08-25 · 読了 3 分記事の要約
1. 核心(What)
- EleutherAI は Aletheia's Quest コンペティションにおける 4 週間の取り組みの振り返りと知見を公開した。
- ブラックボックス監視では、Qwen 3.5 9B などの小さな信頼できるジャッジモデルが有効に機能したことを確認した。
- ホワイトボックス監視では、線形プローブが訓練分布外のデータセットに対して統計的に有意な逆転現象を示すなど、汎用性に課題があることを示した。
- コンペティションの成果として、最良の手法を収めたコンパニオンリポジトリとデータセットのバッテリーを公開した。
2. 影響(Why)
- ブラックボックス監視の実用性: 27B〜120B の大規模モデルに対し、軽量なジャッジモデルを用いたブラックボックス手法が予想以上に高い性能を発揮したため、複雑な内部アクセスなしで安全性監査を組む設計の現実解となる。
- ホワイトボックス検証の限界: 線形プローブが会話分布外で想定外のシグナルを示すため、モデル内部のアクティベーションを用いた不正検知を本番導入する際の判断材料となる。
3. 根拠・詳細(How)
- 評価モデルと環境の制約: Qwen 3.5、Gemma 3、Nemotron 3 Super の 27B〜120B モデルを対象とし、インターネット接続なし、最大 30 分の壁時計時間の制限下で検証を実施した。
- 判定指標とデータセットの構成: Liars' Bench の信念相対的定義に基づき、Iris と Notus の 2 つの検証データセットを含む 30 以上のデータセットでモデルの挙動を評価した。
4. 展望・課題(Next)
- 新たな評価手法の開発: 単一の事実誤認だけでなく、長期的なエージェント作業における省略や歪んだ報告など、従来の枠組みに収まらない欺瞞行動の検知手法の開発が求められている。