🧠Research🔥🔥🔥

Alibaba、2.4T の MoE モデル Qwen3.8-Max と 27B の Qwen3.8-27B の重みを公開──Apache 2.0 で商用利用可能

Alibaba が初の Max クラスとなる 2.4T パラメータモデルを含む Qwen3.8 の重みを Apache 2.0 で公開し、商用利用やローカルでのスケーラブルな運用を加速させた。
リリース: 2026-08-14 · 読了 4

記事の要約

1. 核心(What)

  • Alibaba は 2.4 兆パラメータの sparse MoE モデルである Qwen3.8-2.4T-A95B (Max) と、コンパクトな dense モデル Qwen3.8-27B の重みを Hugging Face および ModelScope で公開した。
  • 両モデルのライセンスは Apache 2.0 であり、Max クラスのオープンソース化は Alibaba にとって初となる。
  • Qwen3.8-27B は SWE-bench Pro で 61.7 を記録し、API 専売だった Qwen3.7-Plus の 57.6 を上回った。
  • Qwen3.8-Max の API 価格は QwenCloud において入力/出力 100 万トークンあたり $2 / $6 に設定されている。

2. 影響(Why)

  • 自社インフラでの 2.4T 運用が可能に: 商用 API に依存していた Max クラスの推論を自社 VPC 内やオンプレミス環境で完結させられるため、機密データを扱う国内の金融・医療系の事業者でも最上位モデルを組み込める選択肢が生まれた。
  • 27B モデルのコストパフォーマンス向上: 商用 LLM API への月額コストを数分の一に抑えたい開発チームにとって、SWE-bench Pro で 61.7 を叩き出す Qwen3.8-27B は社内エージェント基盤の有力なベースラインになる。

3. 根拠・詳細(How)

  • Hybrid Gated DeltaNet の採用: 64 層を 16 ブロックに分割し、3 つの Gated DeltaNet サブレイヤー(線形 O(n) アテンション)と 1 つの Gated Attention サブレイヤーを交互に配置することで、二次的なメモリ爆発を回避しながら 262K のコンテキスト長を実現した。
  • 推論時のパラメータ効率化: Qwen3.8-Max は全体で 2.4 兆パラメータを持つが、トークンあたりのアクティブパラメータ数を 950 億に制限する MoE アーキテクチャを採用し、推論コストを実用的な範囲に抑制している。

4. 展望・課題(Next)

  • 27B 向けホステッド API の提供予定: Qwen3.8-27B のホステッド API の提供が近日中に予定されており、ローカル運用とマネージド API のハイブリッドな検証が可能になる見込み。