DeepSeek、推論モデル DeepSeek V4 Flash を公開──ARC-AGI-1 のタスク単価を 19 ヶ月で 99% 削減
ARC-AGI-1 で 75% 達成コストを 1 タスクあたり 0.01 ドルまで圧縮し、50 回の推論呼出を伴うエージェントワークフローを 1 ドル台で実用化する経済性を提示した。
リリース: 2026-09-29 · 読了 4 分記事の要約
1. 核心(What)
- DeepSeek V4 Flash 0731 は ARC-AGI-1 で 75% の基準線を 1 タスクあたり約 0.01 ドルで達成し、旧モデルの o3-preview と比較してコストを約 99.95% 低下させた。
- ARC-AGI-2 において、DeepSeek V4 Flash は最大負荷設定で 61.4% のスコアを記録し、Gemini 3 Deep Think が 84.6% の精度と 13.62 ドルのコストで首位を維持している。
- 5520 億パラメータの Mixture-of-Experts アーキテクチャを採用し、プロンプト処理時に約 80 億、回答生成時に約 160 億のパラメータをアクティブ化して計算量を抑制する。
- DeepSeek はプロモーション価格だった 75% 割引を恒久化し、V4 Pro の価格を 1 百万トークンあたり 0.003625 から 0.87 ドルに設定している。
2. 影響(Why)
- エージェント構築のコスト構造の変化: 1M トークン級や 50 回の推論を伴うエージェントタスクが 1 ドル台で回せるなら、複数回の検証や検索を挟むリトライ前提の設計が予算内で現実解になる。
- 国内受託開発および SaaS への影響: [国内 AI 受託開発・チャットボット導入ベンダー] 規模の企業は、高価なフラッグシップモデル一辺倒から、定型タスクを DeepSeek などの低コスト推論モデルへルーティングする二段構えのコスト最適化設計へ移行する圧力が強まる。
3. 根拠・詳細(How)
- スパース活性化による演算量の削減: 552B パラメータの MoE 構造において、トークン処理ごとに一部のエキスパートのみを発火させることで、モデルサービングに必要な演算リソースを物理的に抑制している。
- アダプティブ推論によるトークン消費の抑制: 最大負荷設定においても、停止判定アルゴリズムの改善により、過剰な推論トークンの生成を抑えつつタスク解決率を維持する仕組みをとる。
4. 展望・課題(Next)
- 実ワークロード評価の必要性: ARC-AGI のような格子状の抽象推論だけでなく、コード生成や実ドキュメントの RAG などの実環境において同等のコスト削減と精度が維持されるか検証が必要である。