Anthropic、最新モデル Claude Fable 5.1 を公開──Intelligence Index 66 で最高スコアを記録
Artificial Analysis の指標でトップに立ちつつ、キャッシュ読み取り 75% 減と出力トークン増加によりタスク単価が 20% 上昇した。
リリース: 2026-09-01 · 読了 3 分記事の要約
1. 核心(What)
- Claude Fable 5.1 は Artificial Analysis Intelligence Index で 66 を記録し、Opus 5 や GPT-5.6 を上回って首位を獲得した。
- キャッシュ読み取り価格は 100 万トークンあたり $1 から $0.25 へ 75% 引き下げられたが、出力トークン量が 1.7 倍に増加したため、タスクあたりの実効コストは前世代より 20% 高い $3.76 となった。
- HLE で 59.1%、Terminal-Bench v2.1 で 91.4%、SciCode で 62.0% を記録し、長時間のエージェント作業で最高性能を更新した。
- コンテキストウィンドウは 100 万トークン、最大出力は 128,000 トークンで、全 Claude プラットフォームで一般提供が開始された。
2. 影響(Why)
- エージェント検証のコスト構造変化: キャッシュ読み取り 75% 減の恩恵を受けるエージェント開発環境では、タスク単価の上昇相殺を見越しつつ最高精度を導入判断の軸に据える必要がある。
- 国内 SaaS におけるコスト見積もりへの影響: [国内 AI エージェント開発企業] のような中規模事業者は、最大推論時における出力トークン増による単価上昇を前提に、xhigh 設定などのコスト最適化を再設計するインセンティブが生じる。
3. 根拠・詳細(How)
- ベンチマーク評価とスコアの内訳: Artificial Analysis の評価において、HLE 59.1%・GDPval-AA v2 で 1,853 Elo を記録。分析品質で勝る一方で、提示表現の評価では Opus 5 を下回る結果となった。
- 出力トークン増とフォールバック実装: 最大推論設定では 1 世代前比で 1.7 倍の 143.7M トークンを消費。評価時はサーバー側のデフォルトフォールバックが有効化され、安全フラグ付きリクエストの約 4% が Opus 4.8 / Opus 5 にルーティングされている。
4. 展望・課題(Next)
- サイバーセキュリティ向け Twin モデルの展開: 同等の重みを持ちながらセーフガードを軽減した Mythos 5.1 は、ライフサイエンスやサイバーセキュリティ向けの信頼アクセスプログラムに限定して提供される。