DeepSeek、新モデル DeepSeek V4 Flash 0731 を公開──ARC-AGI-1 で 89.0% を記録
推論特化型バリアントで ARC-AGI-1 Semi-Private 89.0%、ARC-AGI-2 Semi-Private 61.4% を達成しつつコストを大幅抑制。
リリース: 2026-07-31 · 読了 3 分記事の要約
1. 核心(What)
- DeepSeek は新モデル DeepSeek V4 Flash 0731 を公開し、ARC-AGI ベンチマークでの検証結果を明らかにした
- ARC-AGI-1 Semi-Private において最大 effort 設定で 89.0% の正答率をマークした
- ARC-AGI-2 Semi-Private では 61.4% の正答率を記録し、難度の高いタスクへ対応する
- コスト面では ARC-AGI-1 が 1 タスクあたり $0.02、ARC-AGI-2 が $0.04 と低価格運用を実現している
2. 影響(Why)
- 高精度と低コストの両立: 1タスク $0.02 級で ARC-AGI-1 の 89% を叩き出すなら、複雑なロジック検証を伴う社内エージェントの自動テスト設計で外注費を数分の一に削れる。
- 国内教育・AI 評価チームへの波及: 国内の LLM ベンチマーク評価を手がける組織([国研機関・大学研究室] 規模)にとって、コスト効率に優れた推論モデルの比較ベースラインが更新された意味は大きい。
3. 根拠・詳細(How)
- 推論バリアントの最大負荷検証: 3 段階の reasoning variants を用意し、最大 effort 構成で ARC-AGI-1 Semi-Private(89.0%)および ARC-AGI-2 Semi-Private(61.4%)のスコアを実測。API コストはそれぞれ $0.02 / $0.04 に固定。
4. 展望・課題(Next)
- 公式 API の一般提供と詳細アーキテクチャ: オープンなAPI提供の詳細や、モデル内部のパラメータ規模・MoE 構成などの詳細スペックは今後の追加発表に委ねられている。