XHToken、軽量モデル Spark-X2.5-4B を公開──1M トークンコンテキストとハイブリッドアテンションを実装
約 20 兆トークンで事前学習され、1M トークンのネイティブコンテキストとハイブリッドアテンションを小型サイズで両立した。
リリース: 2026-09-04 · 読了 3 分記事の要約
1. 核心(What)
- XHToken は、4B および 1.7B パラメータを持つコンパクトな汎用言語モデル Spark-X2.5-4B / 1.7B を Hugging Face にて公開した。
- 事前学習には約 20 兆トークンの多様なコーパスが使用され、数学、コード、論理領域の重みが最適化されている。
- 1M トークンの長文脈対応のため、数百億トークン規模の専用トレーニングステージを経て実装されている。
- 推論時は vLLM や SGLang を用いた OpenAI 互換 API サーバーの構築が可能である。
2. 影響(Why)
- ローカル環境での 1M トークン運用: 商用 API に依存せず、単一 GPU などのコンパクトな環境で 1M トークンの長文脈処理を検証できるため、社内データを取り扱う RAG の選択肢が広がる。
- 国内エージェント開発への影響: Claude Code や Codex などのエージェントハーネスに統合可能な小型 OSS モデルが増えることで、[国内 AI ソリューション企業] などの開発現場では、API コストを削減しつつ自社 Vpc 内へエージェント機能を組み込む設計が現実的になる。
3. 根拠・詳細(How)
- ハイブリッドアテンション構造: 1 つのフルアテンションレイヤーと 3 つのスライディングウィンドウアテンションレイヤーを組み合わせる設計により、長文脈モデルの計算オーバーヘッドを抑制している。
- MOPD によるポリシー統合: 複数のドメイン特化型教師ポリシーの強みを MOPD(Multi-Objective Policy Distillation)技術を用いて単一のデプロイ可能モデルへ統合している。
4. 展望・課題(Next)
- 対応ハードウェアの拡充: NVIDIA に加え、Huawei や Hygon などのプラットフォームにおける実運用の安定性とエコシステムの拡張が予定されている。