🧠Research🔥🔥🔥

DeepSeek、新モデル DeepSeek V4 Flash 0731 を公開──ARC-AGI-1 で 89.0% を記録

推論特化型バリアントで ARC-AGI-1 Semi-Private 89.0%、ARC-AGI-2 Semi-Private 61.4% を達成しつつコストを大幅抑制。
リリース: 2026-07-31 · 読了 3

記事の要約

1. 核心(What)

  • DeepSeek は新モデル DeepSeek V4 Flash 0731 を公開し、ARC-AGI ベンチマークでの検証結果を明らかにした
  • ARC-AGI-1 Semi-Private において最大 effort 設定で 89.0% の正答率をマークした
  • ARC-AGI-2 Semi-Private では 61.4% の正答率を記録し、難度の高いタスクへ対応する
  • コスト面では ARC-AGI-1 が 1 タスクあたり $0.02、ARC-AGI-2 が $0.04 と低価格運用を実現している

2. 影響(Why)

  • 高精度と低コストの両立: 1タスク $0.02 級で ARC-AGI-1 の 89% を叩き出すなら、複雑なロジック検証を伴う社内エージェントの自動テスト設計で外注費を数分の一に削れる。
  • 国内教育・AI 評価チームへの波及: 国内の LLM ベンチマーク評価を手がける組織([国研機関・大学研究室] 規模)にとって、コスト効率に優れた推論モデルの比較ベースラインが更新された意味は大きい。

3. 根拠・詳細(How)

  • 推論バリアントの最大負荷検証: 3 段階の reasoning variants を用意し、最大 effort 構成で ARC-AGI-1 Semi-Private(89.0%)および ARC-AGI-2 Semi-Private(61.4%)のスコアを実測。API コストはそれぞれ $0.02 / $0.04 に固定。

4. 展望・課題(Next)

  • 公式 API の一般提供と詳細アーキテクチャ: オープンなAPI提供の詳細や、モデル内部のパラメータ規模・MoE 構成などの詳細スペックは今後の追加発表に委ねられている。