🧠Research🔥🔥

Tencent、MoE モデル Hy4-preview を公開──総パラメータ数 770B と Gated DSA を採用

総パラメータ数 770B・活性化 49B の MoE アーキテクチャを採用し、社内ブラインド評価でオープンソースのフロンティア水準を達成した。
リリース: 2025-12-02 · 読了 3

記事の要約

1. 核心(What)

  • 総パラメータ数 770B、活性化パラメータ数 49B の MoE モデル Hy4-preview を HuggingFace 等で公開
  • Gated DeepSeek Sparse Attention (Gated DSA) と iHC (identity Hyper-Connections) を採用
  • 推測デコード用のネイティブ MTP 層(総パラメータ数 10B、活性化 0.7B)を組み込み
  • vLLM および SGLang を用いたサービングレシピと AngelSlim による圧縮ツールを提供

2. 影響(Why)

  • オープンソースの選択肢拡大: 商用利用可能な 700B 級の先進的 MoE モデルが手に入ることで、プロプライエタリ API への依存度を下げた高精度な自社パイプライン構築が現実解になる。
  • 推論・開発コストの最適化: SPECULATIVE デコード用 MTP 層や FP8 重みが標準提供されるため、大規模モデルのホスティング費用を抑えた実運用設計が可能になる。

3. 根拠・詳細(How)

  • MoE とアテンション機構の設計: 第 2 層以降の 77 層に 256 routed experts と 1 shared expert を配置し、トップ 8 エキスパートを活性化。Gated DSA と IndexCache によるクロス層のスパースインデックス再利用で長文脈を処理する。
  • 推論サービングの要件: vLLM または SGLang の専用コンテナイメージを使用し、テンソル並列サイズ 8 や MTP による speculative-config を適用して 80GB GPU 環境で動作させる。

4. 展望・課題(Next)

  • 初期バージョンの課題対応: 推論時の過剰な思考時間や自己検証の傾向といった既知の制限事項に対し、迅速なアップデートが予定されている。