Google、Gemini 3.6 Flash 等 3 モデルを発表──推論効率とエージェント性能を強化
Gemini 3.6 Flash は前世代比で出力トークン消費を 17% 削減し、エージェントワークフローのコスト効率と精度を大幅に引き上げた。
リリース: 2026-07-21 · 読了 3 分記事の要約
1. 核心(What)
- Gemini 3.6 Flash を公開。3.5 Flash 比で出力トークン消費を 17% 削減し、MLE Bench で 63.9% の精度を達成。
- Gemini 3.5 Flash-Lite を公開。350 tokens/s の高速推論を実現し、SWE-Bench Pro で 54.2% のスコアを記録。
- Gemini 3.5 Flash Cyber を発表。CodeMender と統合し、CyberGym ベンチマークでフロンティア級の性能を確保。
- 3.6 Flash の価格を 1M 入力トークンあたり $1.50、出力トークンあたり $7.50 に設定。
2. 影響(Why)
- エージェント構築のコスト構造変化: 推論効率の向上とトークン単価の低減により、これまでコスト制約で断念していた多段階推論や反復的なツール利用を伴うエージェント設計が、商用環境で現実的な選択肢となる。
- 国内 SaaS 事業者への影響: 国内の Vertical SaaS や自動化ツール開発者は、既存の Gemini 3.5 ワークロードを 3.6 Flash に移行することで、推論レイテンシを維持しつつ月次の API 利用料を 2 割程度削減できる可能性がある。
3. 根拠・詳細(How)
- トークン効率化の技術的背景: 推論ステップ数とツール呼び出し回数を最適化することで、Artificial Analysis Index において 3.5 Flash 比で 17% のトークン消費削減を達成した。
- エージェント性能の検証指標: OSWorld-Verified ベンチマークで 3.6 Flash は 83.0%(3.5 Flash は 78.4%)を記録し、コンピュータ操作能力の向上が実証されている。
4. 展望・課題(Next)
- Gemini 3.5 Pro の展開: 現在パートナー企業によるテストを実施中であり、準備が整い次第、順次広範な利用が可能となる予定。
- 次世代モデルの開発: Gemini 4 に向けた過去最大規模の事前学習(pre-training)プロセスが既に開始されている。