OpenAI・Anthropic・Meta、GPT-5.6 / Claude Fable 5 / Muse Spark 1.1 を相次ぎ発表
推論特化モデルと自律エージェントの競争が激化し、コーディング・検証タスクで従来比数十倍のコスト効率を実現するモデルが台頭した。
リリース: 2026-07-19 · 読了 5 分記事の要約
1. 核心(What)
- OpenAIがGPT-5.6シリーズを公開。Sol、Terra、Lunaの3モデル体制で、Solには推論時間を拡張するmaxモードと4並列エージェントを調整するultraモードを搭載。
- AnthropicがClaude Fable 5のアクセスを再開し、Claude Sonnet 5をリリース。Sonnet 5は自律的なブラウザ・端末操作を標準サポート。
- Metaがコーディング特化のMuse Spark 1.1を公開し、Llama APIサービスを終了。オープンソースと自社クローズドモデルの二本立て戦略へ移行。
- Mistral AIが119BパラメータのMoEモデルLeanstral 1.5を公開。miniF2Fで100%の正解率を達成し、1問あたり4ドルという低コストで形式検証を実現。
2. 影響(Why)
- 推論コストの劇的な破壊: Leanstral 1.5の1問あたり4ドルというコストは、従来手法の300ドル超と比較して圧倒的。商用RAGや形式検証の運用コストを根本から見直す好機。
- 国内SaaS開発への影響: 国内のバーティカルSaaSや金融系開発チームは、Claude Sonnet 5の自律実行機能を活用することで、従来は人手が必要だったバックオフィス業務の自動化を再設計できる。
3. 根拠・詳細(How)
- Leanstral 1.5の検証性能: 119BパラメータのMoE構造を採用し、miniF2Fの検証・テストセットで100%を達成。PutnamBench 672問中587問を解決する高い論理推論能力を実証。
- GPT-5.6の推論モード: Solモデルのmaxモードは追加の推論時間を割り当てて探索を行い、ultraモードは4つの並列エージェントインスタンスを動的に調整するマルチステップ処理を実装。
4. 展望・課題(Next)
- Metaの次期モデル: MetaはGPT-5.5と同等のベンチマーク性能を持つ大規模モデル「Watermelon」のトレーニングを継続中。