🧠Research🔥🔥

Xiaomi MiMo、エージェント向けモデル MiMo-V2.6-Distill-Qwen-9B を公開──SWE-bench Verified で 61.1% を記録

Qwen3.5-9B をベースに総トークン数 77.4B の SFT データでファインチューニングを実施し、コーディングやセキュリティタスク特化の推論能力を 9B クラスで実現した。
リリース: 2026-09-21 · 読了 3

記事の要約

1. 核心(What)

  • Xiaomi MiMo は Qwen3.5-9B をベースに自社合成データで SFT を施した 9B モデル MiMo-V2.6-Distill-Qwen-9B を公開した。
  • 対応ドメインはコーディング、汎用エージェントタスク、ビジュアルコーディング、サイバーセキュリティの 4 領域にわたる。
  • トレーニングデータには総計 77.4B トークン(loss-bearing トークン 27.2B)が投入されている。
  • 主要評価スコアは SWE-bench Verified 61.1%、SWE-bench Pro 44.6%、Terminalbench 2.1 37.1% を達成している。

2. 影響(Why)

  • 9B 規模における高水準のエージェント能力: 巨大な商用 LLM を使わなければ達成できなかった高度なタスク実行・コード修正を、ローカル運用が容易な 9B パラメータ規模で再現できるため、検証フェーズのインフラ投資を最小化できる。
  • ローカル完結型エージェント開発の加速: 国内の受託開発企業や社内ツール開発チームは、API 利用料を気にせず数千ステップの試行錯誤が必要なエージェント型ワークフローのプロトタイプを自社インフラ上で構築できる。

3. 根拠・詳細(How)

  • データセットとベースモデルの構成: Qwen3.5-9B をベースモデルに採用し、Xiaomi MiMo が独自生成した総トークン数 77.4B(loss-bearing 27.2B)の重み付き SFT データセットを用いてファインチューニングを実行している。
  • 推論実行環境とテンプレート仕様: SGLang の最新ビルドを使用し、専用の mimo パーサと chat template (enable_thinking: True) を指定することで、推論時の思考プロセス (reasoning_content) を出力を伴う形で制御するアーキテクチャを採用している。

4. 展望・課題(Next)

  • 強化学習モデルの展開への布石: 本 SFT チェックポイントは強化学習(RL)を通じた自己改善を目的としたオープンリサーチの出発点として位置づけられており、今後のフル RL 版の公開が期待される。