Google、Gemini 3.6 Flash 等 3 モデルを発表──推論効率とエージェント性能を強化
推論コストを最適化した 3.6 Flash と高速特化の 3.5 Flash-Lite を投入し、エージェントの実装コストを大幅に引き下げる。
リリース: 2026-07-21 · 読了 5 分記事の要約
1. 核心(What)
- Gemini 3.6 Flash を公開。3.5 Flash 比で出力トークン消費量を 17% 削減し、DeepSWE ベンチマークで 49% の精度を達成。
- Gemini 3.5 Flash-Lite を公開。350 トークン/秒の推論速度を実現し、SWE-Bench Pro で 54.2% のスコアを記録。
- Gemini 3.5 Flash Cyber を発表。CodeMender と連携し、CyberGym ベンチマークで競争力のある性能を発揮。
- 3.6 Flash の価格は 100 万入力トークンあたり 1.50 ドル、100 万出力トークンあたり 7.50 ドルに設定。
2. 影響(Why)
- エージェント実装の経済性: トークン効率の向上とコスト削減により、これまで推論コストがボトルネックとなっていた複雑なマルチステップ・エージェントの実装が現実的な予算で可能になる。
- 国内 SaaS におけるコスト最適化: 国内の Vertical SaaS や EC サイト運営企業は、既存の Gemini 3.5 Flash ベースのチャット・解析機能を 3.6 Flash へ移行することで、精度を維持しつつ推論コストの 2 割削減を狙える。
3. 根拠・詳細(How)
- モデルの効率化と性能検証: 3.6 Flash は推論時のステップ数とツール呼び出し回数を削減し、MLE Bench で 63.9%(3.5 Flash 比 14.2pt 増)の精度を達成。OSWorld-Verified では 83.0% のタスク成功率を記録。
- 高速推論のアーキテクチャ: 3.5 Flash-Lite は 3.1 Flash-Lite と比較し、Terminal-Bench 2.1 で 54%(従来比 23pt 増)の性能向上を実現。API 経由でコンピュータ操作ツールを内蔵し、高スループット環境でのエージェント実行に最適化。
4. 展望・課題(Next)
- Gemini 3.5 Pro の展開: 現在パートナー向けにテスト中の Gemini 3.5 Pro を順次一般公開予定。
- 次世代モデルの開発: Gemini 4 に向けた大規模な事前学習フェーズを開始しており、次世代の性能向上を計画中。