MLLM の安全性を 4 次元で評価するベンチマーク MME-Safety──17 モデルの検証で脆弱性を解明
リスクシナリオやモダリティ別の隠蔽度を含む 4 次元アノテーションスキーマにより、17 の SOTA MLLM の安全性プロファイルを網羅的に評価した。
リリース: 2026-08-08 · 読了 5 分論文概要
Multimodal Large Language Models (MLLMs) の急速な発展に伴い、単一モダリティ向けフィルターでは検知しきれないクロスモーダルな脆弱性が問題となっている。本論文では、リスクシナリオ、危害の深刻度、モダリティ固有の隠蔽度を網羅する 4 次元アノテーションスキーマを備えた厳密なベンチマーク「MME-Safety」を提案する。17 の SOTA MLLM を用いたゼロショット評価を通じて、現在のマルチモーダルシステムの安全性プロファイルを体系的に明らかにした。
関連研究
既存の安全性評価ベンチマークは、意図に関する詳細なアノテーションが欠如しており、単一の次元に基づく指標に依存していたため、包括的な堅牢性の評価が困難であった。本研究は、階層的な評価フレームワークと多次元のアノテーションを導入することで、これら既存手法の限界を克服している。
新規性と貢献
本研究の主要な貢献は、リスクシナリオ、危害の深刻度、モダリティ特有の隠蔽度を組み合わせた 4 次元アノテーションスキーマの確立にある。また、基礎的な応答信頼性、実際のリスク露呈、防衛的行動の構造的整合性を評価する階層型評価フレームワークにより、従来の一次元的評価では捉えられなかった脆弱性を可視化した点に学術的・実用的な意義がある。
提案手法の詳細
MME-Safety は、クロスモーダルな入力設定を体系的に調査するため、入力に含まれる意図やリスクを多角的に分解する設計を採用している。なぜこの設計にしたかといえば、テキストと画像が組み合わさることで生じる複雑な脅威や、既存フィルターをすり抜ける隠蔽された攻撃ベクトルを正確に切り分ける必要があるためである。さらに、Chain-of-Thought (CoT) 推論が安全性に及ぼす影響についても構造的な分析を行っている。
評価・考察
17 の最先端 MLLM を対象としたゼロショット評価を実施し、モデルごとの安全性プロファイルの差異を定量的に示した。実験結果から、クロスモーダル入力の構成や CoT 推論の挙動がモデルの安全性に直接的な影響を与えることが裏付けられており、マルチモーダル領域における推論を意識した安全性アライメントの必要性が示されている。
応用例と今後の展望
本ベンチマークは、自動運転や医療画像解析など、高い安全性が求められる分野で採用される MLLM のデプロイ前検証に直結する。特に、国内の AI システム開発企業やセキュリティ監査部門において、マルチモーダルモデルの脆弱性を網羅的にスクリーニングするための実務的な評価基盤として活用される。今後は、より多様な攻撃シナリオへの拡張と、効率的な防御手法の開発が求められる。
結論
MME-Safety は、MLLM のクロスモーダルな脆弱性を多角的に評価するための強固なベンチマークを提供する。17 モデルの評価を通じて、従来の単一モダリティ向けフィルターの限界と、推論プロセスにおける安全性の重要性を明らかにした。
注釈
- MLLM: 画像や音声などの複数モダリティを同時に処理できる大規模言語モデル。
- Chain-of-Thought (CoT): モデルが段階的な思考プロセスを出力することで、複雑な推論能力を高める手法。