250B MoEモデルSolar Open 2を公開──1Mトークン長文脈とエージェント特化学習で性能向上
1Mトークンのコンテキスト窓とMulti-teacher On-Policy Distillationにより、同規模のオープンウェイトモデルを凌駕するエージェント性能を実現した。
リリース: 2026-07-22 · 読了 8 分論文概要
Solar Open 2は、総パラメータ数250B(アクティブパラメータ15B)のMixture-of-Experts (MoE) 構造を持つ言語モデルである。エージェントによる長時間のタスク遂行を想定し、100万トークンのコンテキスト窓をサポートする。Solar Open 1からの重み転移と、10Tトークンの高品質データセットによる学習、さらにMulti-teacher On-Policy Distillation (MOPD) を用いたエージェントスキルの統合が特徴である。

関連研究
既存のオープンウェイトモデルであるDeepSeek-V4-FlashやMiMo-V2.5と比較し、特にエージェントタスクにおける性能と韓国語処理能力の最適化に注力している点が先行研究との大きな違いである。
新規性と貢献
- 長文脈処理の実現: 位置エンコーディングを用いず、線形アテンションとソフトマックス層を交互に配置するハイブリッドアテンションスタックにより、1Mトークンのコンテキスト長を効率的に処理する。
- 効率的な学習手法: Solar Open 1の重みを初期値として活用し、計算予算を最適化しつつ、データ価値を重視した10Tトークンの混合データで事前学習を完遂した。
- エージェントスキルの統合: 12のドメイン特化モデルをMOPDにより単一モデルへ統合し、エージェント性能を強化した。
提案手法の詳細
本モデルは、エージェントの軌跡全体をコンテキストに保持するために、線形アテンションとソフトマックス層を3:1の割合でインターリーブする設計を採用している。また、負の固有値まで拡張したゲート付きデルタルールを用いることで、位置エンコーディングなしでの長文脈推論を可能にした。学習面では、Solar Open 1から5.69Bパラメータの共有スケルトンを転移させ、残りをフル事前学習させることで、計算効率を最大化している。

評価・考察
英語ベンチマーク(MMLU-Pro, LiveCodeBench, APEX-Agents)において、同規模のオープンウェイトモデルをリードする性能を示した。特に韓国語ベンチマークでは、クローズドAPIモデルを含む比較対象の中で最高の平均スコアを記録した。社内ベンチマークであるKo-GDPvalでは、DeepSeek-V4-Pro(1.6T)の6分の1以下のサイズで同等の性能を達成している。

応用例と今後の展望
本モデルは、長時間のオフィスワーク自動化や複雑なエージェントタスクにおいて高い実用性を持つ。特に韓国語を用いたビジネスアプリケーション開発において、計算リソースを抑えつつ高性能なエージェントを構築したい開発者にとって、重要な選択肢となるだろう。今後の課題は、より大規模なデータセットでのスケーリングと、さらなる推論効率の向上である。
結論
Solar Open 2は、長文脈処理と高度なエージェントスキルを両立させたモデルであり、特にリソース制約下でのエージェント性能において既存の巨大モデルに匹敵する効率性を示した。
注釈
- MoE (Mixture-of-Experts): 入力に応じてモデル内の特定の専門家ネットワーク(エキスパート)のみを活性化させる手法。
- MOPD (Multi-teacher On-Policy Distillation): 複数の教師モデルからオンポリシーで知識を蒸留し、単一のモデルに統合する手法。