🧠Research🔥🔥

OpenAI、評価ベンチマーク MentalHealthBench を公開──日常のストレス対応や臨床評価を 10 次元で測定

22 カ国 80 名以上の臨床医と共同開発した MentalHealthBench により、AI のメンタルヘルス対応を非日常の危機対応から日常的ストレスまで 10 の行動次元で評価可能にした。
リリース: 2026-09-23 · 読了 4

記事の要約

1. 核心(What)

  • OpenAI は 22 カ国 80 名以上の臨床医と共同で、メンタルヘルス会話評価用ベンチマーク MentalHealthBench を公開した。
  • 評価対象は日常のストレス、関係性の葛藤、介護の悩みなど、危機対応以外の日常的な相談シナリオを含む。
  • 評価基準は -10 から +10 の臨床ウェイトが付与され、GPT-5.6 による自動グレーディングで 10 の行動次元を測定する。
  • 44 名のユーザー調査では、専門家が重視する文脈把握よりも、ユーザーはトーンや具体的な次の一歩を重視する傾向が示された。

2. 影響(Why)

  • 汎用チャットの品質検証コストが下がる: メンタルヘルス関連の相談は汎用チャットでも偶発的に発生するため、開発チームはリリース前に臨床的リスクや安全性をベンチマークで定量検証できる。
  • 国内メンタルヘルス SaaS の評価基準に直結: 対話型カウンセリングやメンタルヘルスケアを提供する国内 SaaS 運営企業は、モデル選定やシステムプロンプトの調整において客観的な臨床評価指標として活用できる。

3. 根拠・詳細(How)

  • 合成会話と専門家による臨床ウェイト設計: プライバシーを保護した合成会話データに対し、3 名以上の専門家による合意形成を経て -10 から +10 の臨床ウェイトを付与する仕組みを採用している。
  • GPT-5.6 による自動グレーディングと 10 次元分析: 単一のスコアではなく、文脈の追求やユーザー主体の尊重など 10 の行動次元に分解し、GPT-5.6 を用いてモデル出力を一貫して評価する。

4. 展望・課題(Next)

  • 実運用における臨床的安全性の限界: 合成データと自動グレーディングによる評価であり、実際の長期的会話や臨床的安全性を直接保証するものではないため、専門家による実地検証の併用が必要となる。