Xiaomi、マルチモーダル学習モデル MiMo-V2.6-Flash-RL を公開──Sparse MoE 構造と GRPO による強化学習で 15B 有効パラメータを達成
テキスト・画像・音声・動画の 4 モダリティを 1M トークンのコンテキスト長で統合し、大規模非同期 GRPO と報酬最適化により自己改善ループを回す効率重視型チェックポイント。
リリース: 2026-09-27 · 読了 4 分記事の要約
1. 核心(What)
- 総パラメータ数 309B、有効パラメータ数 15B の Sparse MoE アーキテクチャを採用した MiMo-V2.6-Flash-RL が公開された。
- 1M トークンのコンテキスト長をサポートし、テキスト・画像・動画・音声を単一のモデルでネイティブに処理する。
- 非同期 GRPO を用いて 1,568 プロンプト×16 ロールアウトのバッチ規模で強化学習スケーリングを実行している。
- SGLang および vLLM の専用レシピが提供され、テンソル並列数などの設定でデプロイ可能となっている。
2. 影響(Why)
- 1M トークンと 4 モダリティの統合: 長大なリポジトリやマルチセッションのエージェント実行を単一モデルで扱えるため、複数モデルを直列につなぐパイプライン設計の複雑さを解消できる。
- 国内 SaaS における推論コスト最適化: 国内のマルチモーダル解析を手がける中規模 SaaS 事業者は、309B 総パラメータのうち 15B のみが発火する Sparse MoE 構造により、API コストを既存の大規模モデル比で大幅に抑えられる選択肢を手に入れた。
3. 根拠・詳細(How)
- アーキテクチャとエンコーダ仕様: 681M パラメータの MiMo ViT(24 層 SWA と 4 層 Full アテンション)と 308M の AudioTokenizer(1024 隠れ層、20 RVQ コードブック)を組み合わせたマルチモーダル構成をとる。
- 報酬設計と強化学習の仕組み: Groupwise Reward Synthesis(GRS)と Groupwise Advantage Redistribution(GAR)により、グループ内のロールアウトを比較してタスク固有のルーブリックを生成し、選好最適化を行っている。
- 推論高速化の仕組み: 5 層の SWA MTP ドラフター(DFlash 方式)を搭載し、フォワードパスごとに 7 つの後続トークンを予測して並列検証を行うことで推論スループットを高めている。
4. 展望・課題(Next)
- オープンエコシステムでの検証: OpenRouter や HuggingFace 経由でのアクセスに加え、SGLang および vLLM の Docker イメージを用いたローカル検証が進む見通し。