📜Papers🔥🔥

マルチモーダル LLM のポストトレーニング手法 Pistis──IDRL による強化学習と蒸留の統合と推論ハーネスの自動最適化

Qwen3.6/3.5 を基盤とする 27B/9B の Pistis モデル群を提案し、IDRL と PAH によりマルチモーダル推論とエージェント性能を大幅に向上させた。
リリース: 2026-09-23 · 読了 5 分

論文概要

本論文では、Qwen3.6 および Qwen3.5 を基盤モデルに採用した 27B および 9B パラメータのマルチモーダル大規模言語モデル(MLLM)ファミリー「Pistis」を提案する。大規模なマルチモーダル教師あり微調整(SFT)を出発点とし、オンポリシー蒸留と強化学習を単一の学習ループ内で統合する新たなポストトレーニングパラダイム「Interleaved Distillation and Reinforcement Learning (IDRL)」を導入した点が最大の特徴である。さらに、モデルパラメータを更新することなく推論時のハーネスを自動最適化するシステムレベルの手法「Pistis-Auto-Harnessing (PAH)」もあわせて提案されている。

Figure 1: IDRL(Interleaved Distillation and Reinforcement Learning)のフレームワーク全体図。

関連研究

従来のマルチモーダルモデルのポストトレーニングでは、静的な結合損失関数を用いたアプローチや、蒸留と強化学習を個別に最適化する手法が主流であった。しかし、これらの従来手法では長文脈エージェントの軌跡に対する正確なクレジットアサイン(報酬割当)が困難であり、能力間のトレードオフが生じやすいという課題があった。本研究の IDRL は、これらを交互に最適化することで、より効果的な知識転移と最適化の安定性を両立している。

新規性と貢献

本研究の主要な貢献は以下の 2 点に集約される。第一に、蒸留と強化学習を交互に統合する IDRL パラダイムの構築であり、これによりマルチモーダル推論能力とエージェント機能のトレードオフを緩和することに成功した。第二に、モデルの重みを変更せずに推論ハーネスを自動改善するシステム手法 PAH の提案である。これにより、インタラクションバジェットを増加させることなくモデル性能の底上げが可能となった。

提案手法の詳細

Pistis ファミリーは、基盤となる SFT の上に IDRL を適用し、用途に応じて 2 つの特化型バリアントを展開する。1つは深層マルチモーダル推論を強化する「Pistis-Thinking」、もう1つは長文脈計画、反復推論、ツール利用をサポートするエージェント軌跡データを追加した「Pistis-Agentic」である。また、システム側の PAH は、図 3 に示すように反復的な最適化を通じてエージェントの推論ハーネスを自動的に改善するループを備えている。

Figure 3: Pistis-Auto-Harnessing(PAH)による自動ハーネス最適化の閉ループ手順を示す概要図。

評価・考察

実験において、Pistis の各スケールモデルは対応するベースモデルの性能を上回る結果を示した。特に Pistis-Agentic はマルチモーダル検索タスクにおいて優れた性能を発揮し、PAH の導入によりパラメータ更新なしでの性能向上が確認されている。

応用例と今後の展望

応用面としては、複雑な視覚情報と長文脈の推論が要求されるマルチモーダル検索や自律エージェントシステムへの統合が挙げられる。日本の製造業・テック企業における実務インパクトとして、例えば医療分野や金融文書解析におけるマルチモーダルドキュメント処理システム(数十万ドキュメント規模)において、高精度な推論エージェントを効率的に構築するための実践的な基盤技術となり得る。今後の課題としては、より多様な実環境エージェントタスクへのスケーラビリティ検証が必要である。

結論

Pistis は、Qwen 基盤の MLLM に対し、IDRL による統合的ポストトレーニングと PAH によるシステム最適化を組み合わせることで、マルチモーダル推論およびエージェント性能を効果的に引き出すことに成功した。モデルの拡張性と実用性を兼ね備えた強力なアプローチを提示している。

注釈

  • IDRL (Interleaved Distillation and Reinforcement Learning): オンポリシー蒸留と強化学習を単一のループ内で交互に最適化するポストトレーニング手法。
  • PAH (Pistis-Auto-Harnessing): モデルのパラメータを変更せず、反復的最適化により推論時のハーネスを自動改善するシステムレベルの手法。