🎨Product🔥🔥🔥

DeepSeek、LLM アプリフレームワーク向け新モデル DeepSeek-V4.1-Flash を発表──パラメータ数 552B でフラッグシップ超えと値下げを両立

DeepSeek-V4.1-Flash は新しい MoE アーキテクチャと KV キャッシュ削減により、オフピーク入力料金を最大 0.003 ドル/1k token まで引き下げつつフラッグシップ機を超える性能を実現した。
リリース: 2026-09-10 · 読了 3

記事の要約

1. 核心(What)

  • DeepSeek は 2026 年 9 月 10 日、新モデル「DeepSeek-V4.1-Flash」を発表した。
  • 全体のパラメータ数は 5520 億(552B)の MoE アーキテクチャを採用している。
  • 一部のベンチマークにおいて「DeepSeek-V4-Pro」や「GPT-5.6 Sol」、「Claude Opus 5」を超える性能をうたう。
  • 8 月 13 日の料金値上げから一転し、同日からオフピーク時入力料金をキャッシュヒット時 0.003 ドル、ミス時 0.15 ドルへ値下げした。

2. 影響(Why)

  • API コストの劇的な削減: 100 万トークン級の入力コストが実質半減以下になるため、社内 RAG で全件コンテキストを渡す構成のランニングコストを大幅に抑えられる。
  • 国内 SaaS の推論基盤の再考: [国内 AI チャットボット・要約 SaaS 業種] のような中規模事業者は、月額の API 予算を維持したまま処理スループットを倍増させるためのモデル移行検証を今週から開始すべき。

3. 根拠・詳細(How)

  • KV キャッシュ削減と新アーキテクチャ: 過去の計算内容の保持量を削減しデータ入力効率を高める新機構を採用。オフピーク時の出力料金は 0.60 ドル/1k token に設定されている。
  • MoE による選択的アクティベーション: 552B の全パラメータを常時発火させず、入力内容に応じて複数用意された処理役の一部だけを動かすことで処理効率を高める設計。

4. 展望・課題(Next)

  • ピーク時の料金体系と可用性: ピークタイムの料金はオフピークの 2 倍に設定されており、日中帯のトラフィック集中を避けたバッチ処理設計の切り替えが求められる。