🧠Research🔥🔥

Kuleshov Group、拡散言語モデルの構築手法を公開──マスク拡散によるテキスト生成の仕組みを解説

自己回帰型とは異なり、全トークンを同時に生成して反復的に洗練させる拡散言語モデル(Diffusion LLM)の数学的基礎と実装アーキテクチャを体系的に整理した。
リリース: 2026-07-05 · 読了 4

記事の要約

1. 核心(What)

  • Kuleshov Group は 2026 年 7 月 5 日、離散データ向けの拡散モデル(Diffusion Language Model)の構築手法に関する技術解説を公開した。
  • 自己回帰型モデルの左から右へ 1 トークンずつ生成するアプローチに対し、拡散モデルは全シーケンスを同時に生成し反復的に洗練させる。
  • ノイズ付加のプロセスとして、連続値の Gaussian ノイズではなくランダムにトークンを隠すマスク拡散(Masked Diffusion)を採用している。
  • 学習済みの unmasking transformer を用いて、完全にマスクされた状態から複数回のステップを経てクリーンなテキストを復元する仕組みを定義した。

2. 影響(Why)

  • 生成速度と品質のトレードオフ調整: ステップ数を動的に変更して速度と品質を調整できるため、リアルタイム応答が求められる対話型 AI 基盤の推論スループット設計に新たな選択肢をもたらす。
  • 国内音声・テキスト生成 SaaS への影響: [国内 音声・テキスト生成 SaaS 業種] のような中規模事業者は、自己回帰型一辺倒だった既存の推論パイプラインを見直し、並列生成によるレイテンシ削減の検証を検討する価値がある。

3. 根拠・詳細(How)

  • マスク拡散による離散ノイズ定義: シグナル対ノイズ比に相当するスケジュール $\alpha_t$ を用い、マルコフ連鎖を通じてクリーンなシーケンスから徐々にトークンをマスクして学習用軌跡を生成する。
  • 双方向 Transformer による復元学習: BERT と同様のランダムマスク率を持つ双方向 Transformer をベースにし、現在状態から最終的なクリーンシーケンスを予測するモデル $x_\theta(z_t)$ を訓練する。

4. 展望・課題(Next)

  • 大規模モデルへの適用と検証: Mercury 2 などの産業界における実用化を受け、より大規模なパラメータ数でのスケーラビリティやポストトレーニング手法の最適化が今後の課題となる。