Kuleshov Group、拡散言語モデルの構築手法を公開──マスク拡散によるテキスト生成の仕組みを解説
自己回帰型とは異なり、全トークンを同時に生成して反復的に洗練させる拡散言語モデル(Diffusion LLM)の数学的基礎と実装アーキテクチャを体系的に整理した。
リリース: 2026-07-05 · 読了 4 分記事の要約
1. 核心(What)
- Kuleshov Group は 2026 年 7 月 5 日、離散データ向けの拡散モデル(Diffusion Language Model)の構築手法に関する技術解説を公開した。
- 自己回帰型モデルの左から右へ 1 トークンずつ生成するアプローチに対し、拡散モデルは全シーケンスを同時に生成し反復的に洗練させる。
- ノイズ付加のプロセスとして、連続値の Gaussian ノイズではなくランダムにトークンを隠すマスク拡散(Masked Diffusion)を採用している。
- 学習済みの unmasking transformer を用いて、完全にマスクされた状態から複数回のステップを経てクリーンなテキストを復元する仕組みを定義した。
2. 影響(Why)
- 生成速度と品質のトレードオフ調整: ステップ数を動的に変更して速度と品質を調整できるため、リアルタイム応答が求められる対話型 AI 基盤の推論スループット設計に新たな選択肢をもたらす。
- 国内音声・テキスト生成 SaaS への影響: [国内 音声・テキスト生成 SaaS 業種] のような中規模事業者は、自己回帰型一辺倒だった既存の推論パイプラインを見直し、並列生成によるレイテンシ削減の検証を検討する価値がある。
3. 根拠・詳細(How)
- マスク拡散による離散ノイズ定義: シグナル対ノイズ比に相当するスケジュール $\alpha_t$ を用い、マルコフ連鎖を通じてクリーンなシーケンスから徐々にトークンをマスクして学習用軌跡を生成する。
- 双方向 Transformer による復元学習: BERT と同様のランダムマスク率を持つ双方向 Transformer をベースにし、現在状態から最終的なクリーンシーケンスを予測するモデル $x_\theta(z_t)$ を訓練する。
4. 展望・課題(Next)
- 大規模モデルへの適用と検証: Mercury 2 などの産業界における実用化を受け、より大規模なパラメータ数でのスケーラビリティやポストトレーニング手法の最適化が今後の課題となる。