🛠Tools🔥🔥🔥

Empero AI、推論特化型ローカルモデルランナー Qwythos-9B-Claude-Mythos-5-1M-GGUF を公開──MMLU +34pt 向上と 1M コンテキストを実現

Claude の思考トレース 5 億トークンで事後学習した Qwen3.5-9B ベースの推論モデルを GGUF 化し、単一 GPU での 1M コンテキストと MTP ドラフト推論に対応させた。
リリース: 2026-07-11 · 読了 3

記事の要約

1. 核心(What)

  • Empero AI が Qwen3.5-9B をベースとした推論モデルの GGUF 版を公開した。
  • 5 億トークン以上の Claude 思考トレースデータを用いて事後学習が実施されている。
  • YaRN rope-scaling によりデフォルトで 1,048,576 トークンのコンテキストを処理可能である。
  • MTP ドラフト推論ヘッドを同梱し、llama.cpp などの主要ランナーで動作する。

2. 影響(Why)

  • ローカルでの高度な推論と長文脈の両立: 9B パラメータという軽量なサイズでありながら MMLU で +34pt の向上を達成しており、長大なコードベースや仕様書を丸ごと読み込ませるローカル RAG 設計が現実解になる。
  • 国内実務システムへの組み込みやすさ: [国内 BtoB SaaS 開発企業] のようにデータプライバシーの観点から商用 API を使いづらい現場でも、GGUF 形式と Apache-2.0 ライセンスにより検証から本番導入までのハードルが低い。

3. 根拠・詳細(How)

  • モデル構造とコンテキスト拡張の仕組み: ベースの Qwen3.5-9B に対し、Claude 系モデルの思考トレースを 5 億トークン以上用いてフルパラメータ SFT を実施し、YaRN rope-scaling で 1M コンテキストを実現している。
  • ランナー統合と MTP ドラフト推論: llama.cpp の --spec-type draft-mtp オプションに対応する MTP ヘッドが GGUF 内に復元されており、対応ビルドを用いることで推論の高速化を図れる。

4. 展望・課題(Next)

  • ビジョン機能の評価と実運用: ビジョンタワーはベースの Qwen3.5-9B から変更されていないため、画像認識を伴うタスクでは個別の事前検証が推奨される。