Artificial Analysis、医療長文脈推論ベンチマーク MLCR-AA を公開──大多数の AI モデルが臨床合成タスクで失敗
25k〜64k トークンの保険・医療請求文書の解析で、Claude Fable 5 が 64.4% で首位に立つ一方、中央値モデルは 15% 未満にとどまった。
リリース: 2026-08-21 · 読了 3 分記事の要約
1. 核心(What)
- Artificial Analysis が Wisedocs のベンチマークをベースにした医療長文脈推論リーダーボード「MLCR-AA」を公開
- Claude Fable 5 が総合 64.4% で首位、オープンウェイトでは Kimi K3 (max) が 38.3% で最高値を記録
- GPT-5.6 Terra (max) は正解率(Accuracy)で 93.7% を記録したが網羅性(Completeness)の課題で総合 10 位に低迷
- 評価対象のケースは 25k〜64k トークン規模で、採点には 3 モデルによる過半数投票ジャッジパネルを採用
2. 影響(Why)
- 網羅性欠如の課題が明確化: 単一の事実抽出(Needle-in-a-haystack)ではなく 100 ページ超の臨床合成を評価するため、実務 RAG のモデル選定基準が正解率から網羅性へシフトする。
- 国内医療 SaaS におけるコスト試算: 国内の電子カルテや保険査定を自動化する SaaS 開発チームは、最高精度を出す $1/タスクの Claude 構成と、1/6 コストの Kimi K3 系列のどちらをプロダクトに載せるか損益分岐点の再設計が必要になる。
3. 根拠・詳細(How)
- 難易度の高い 2 ティアへの絞り込み評価: Wisedocs の 10 ケース(50〜55 の医療サマリーを含む 25k〜64k トークン)のうち、明示的な記述がない推論を要する Expert と複数質問が混在する Compound の 2 つの難易度ティアのみ抽出してテスト。
- コンシスネスゲートと 3 モデル判定: 参照回答長の 5 倍を超える出力を弾く長さチェックを通過させた上で、Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.5 の 3 モデルによる多数決パネルで Accuracy と Completeness を評価。
4. 展望・課題(Next)
- 公開データセットと評価ハーネスの利用: 難易度下位の 3 ティア分のデータセットと評価 harness が Hugging Face と GitHub で公開されており、チームはローカルでの再現検証が可能。