OpenAI、プロンプトキャッシュ基盤を強化──GPT-6 向けに最大 90% 割引とダッシュボードを公開
OpenAI は GPT-6 向けプロンプトキャッシュを刷新し、最大 90% の入力割引とキャッシュミス診断 API を導入することでエージェントの実装コストを劇的に圧縮する。
リリース: 2026-09-22 · 読了 3 分記事の要約
1. 核心(What)
- OpenAI は GPT-6 向けプロンプトキャッシュ機能を拡張し、キャッシュ済み入力トークンに対して最大 90% の割引を提供開始した。
- ヒット率の推移やトークン内訳を可視化する Prompt Caching Dashboard と、ミス理由を構造化して返す Diagnostics API を追加した。
- 明示的なキャッシュブレークポイントや、会話中の推論負荷変更でもキャッシュを維持する機能を実装した。
- Manus などの実証チームでヒット率が 90% 超へ向上し、推論コストを 36% 削減した実績が報告されている。
2. 影響(Why)
- エージェント運用コストの抜本的圧縮: 数千トークンのシステム指示やツール定義を毎回送信する常時稼働エージェントにおいて、最大 90% の割引と 90% 超のヒット率は月額 API コストを数分の一に押し下げる。
- 国内 SaaS のアーキテクチャ再設計: 国内で Vertical SaaS を展開する中堅開発チームは、トークンキャッシュ前提のプロンプト設計に移行することで競合に対するコスト優位性を確保できる。
3. 根拠・詳細(How)
- Diagnostics API によるミス原因特定: キャッシュミス時に tools_changed などの構造化された理由コードと、影響を受けたトークン数(例: 5,629 トークン)をレスポンスで返し、プロンプトの劣化を即座に検知する。
- 推論設定変更時のキャッシュ維持機構: GPT-6 では、リクエストレベルの reasoning-effort を維持したまま configuration_update を付加して会話中の推論負荷を変更でき、既存のキャッシュ済みプレフィックスを無効化しない。
4. 展望・課題(Next)
- プリウォーミング運用の標準化: 起動時に共通コンテキストやツール定義をあらかじめ送信するプレウォーミングを組み込み、初回のユーザーリクエストから高キャッシュヒットを狙う運用設計が求められる。