Ant Group、混合推論モデル Ling 3.1 Flash を公開──560B パラメータでエージェント性能が 2 倍に向上
560B パラメータ総数と 25B アクティブパラメータを持つ MoE 構造を採用し、Terminal-Bench などのエージェント評価で前世代からスコアを倍増させた。
リリース: 2026-10-06 · 読了 3 分記事の要約
1. 核心(What)
- Ant Group の InclusionAI が混合推論モデル「Ling 3.1 Flash」を Novita AI 経由で公開した。
- モデルの総パラメータ数は 560B、アクティブパラメータ数は 25B の MoE 構造となっている。
- Artificial Analysis Intelligence Index v4.3 においてスコア 41 を記録し、前世代 Ling 3.0 Flash の 20 から倍増した。
- 価格は入力 100 万トークンあたり $0.30、出力 100 万トークンあたり $0.90、キャッシュ済み入力が $0.06 に設定されている。
2. 影響(Why)
- マルチステップ・ツール連携の検証価値: Terminal-Bench や AutomationBench-AA で大幅なスコア向上が確認されており、ターミナル操作やツール連鎖を伴う複雑なワークフローを構築するチームは評価の価値がある。
- 国内 SaaS におけるコストと精度のトレードオフ: 国内の自動化・エージェント開発を手掛ける中規模 SaaS 事業者は、API の単価上昇とトークン効率の改善を勘案し、既存の Flash 系モデルからの移行コストを再検証する必要がある。
3. 根拠・詳細(How)
- 補助ロスフリーシグモイドルーティングと構造: auxiliary-loss-free sigmoid routing、マルチトークン予測、QK-Norm、Partial-RoPE を組み合わせ、アテンションの安定化と効率的なエキスパート選択を実現している。
- ベンチマークスコアの具体的向上: Terminal-Bench v4.0 で 33 ポイント増、AutomationBench-AA で 59 ポイント増を記録し、タスク実行精度の向上がハルシネーション抑制に寄与している。
4. 展望・課題(Next)
- オープンウェイトの公開予定: 数週間以内に重みの公開が予定されているが、正確な日付やライセンス、チェックポイント形式は未確定である。
- ホステッド環境とコンテキストの拡張: 現在は Novita AI 経由で 262K コンテキスト長で提供されており、将来的に 1M トークンコンテキストへの対応が目標とされている。