Xiaomi MiMo、エージェント向けモデル MiMo-V2.6-Distill-Qwen-9B を公開──SWE-bench Verified で 61.1% を記録
Qwen3.5-9B をベースに総トークン数 77.4B の SFT データでファインチューニングを実施し、コーディングやセキュリティタスク特化の推論能力を 9B クラスで実現した。
リリース: 2026-09-21 · 読了 3 分記事の要約
1. 核心(What)
- Xiaomi MiMo は Qwen3.5-9B をベースに自社合成データで SFT を施した 9B モデル MiMo-V2.6-Distill-Qwen-9B を公開した。
- 対応ドメインはコーディング、汎用エージェントタスク、ビジュアルコーディング、サイバーセキュリティの 4 領域にわたる。
- トレーニングデータには総計 77.4B トークン(loss-bearing トークン 27.2B)が投入されている。
- 主要評価スコアは SWE-bench Verified 61.1%、SWE-bench Pro 44.6%、Terminalbench 2.1 37.1% を達成している。
2. 影響(Why)
- 9B 規模における高水準のエージェント能力: 巨大な商用 LLM を使わなければ達成できなかった高度なタスク実行・コード修正を、ローカル運用が容易な 9B パラメータ規模で再現できるため、検証フェーズのインフラ投資を最小化できる。
- ローカル完結型エージェント開発の加速: 国内の受託開発企業や社内ツール開発チームは、API 利用料を気にせず数千ステップの試行錯誤が必要なエージェント型ワークフローのプロトタイプを自社インフラ上で構築できる。
3. 根拠・詳細(How)
- データセットとベースモデルの構成: Qwen3.5-9B をベースモデルに採用し、Xiaomi MiMo が独自生成した総トークン数 77.4B(loss-bearing 27.2B)の重み付き SFT データセットを用いてファインチューニングを実行している。
- 推論実行環境とテンプレート仕様: SGLang の最新ビルドを使用し、専用の mimo パーサと chat template (enable_thinking: True) を指定することで、推論時の思考プロセス (reasoning_content) を出力を伴う形で制御するアーキテクチャを採用している。
4. 展望・課題(Next)
- 強化学習モデルの展開への布石: 本 SFT チェックポイントは強化学習(RL)を通じた自己改善を目的としたオープンリサーチの出発点として位置づけられており、今後のフル RL 版の公開が期待される。