📜Papers🔥🔥

Pass@K と Pass@1 の乖離に着目した学習手法 GapFT──LogiQA 2.0 で 14.4pt 向上

検証済み報酬を用いた強化学習において Pass@K と Pass@1 のギャップを活用し、データ効率を 3 倍に高めつつベースモデル比で大幅な精度向上を実証した。
リリース: 2026-09-17 · 読了 4 分

論文概要

Large Language Models (LLMs) の事後学習において、検証可能な報酬を用いた強化学習 (RLVR: Reinforcement Learning from Verifiable Rewards) が広く採用されている。本論文では、1 回のデコード(シングルサンプル)での出力結果と、複数サンプルのうち正解を選ぶテスト時スケーリング(Pass@K)の間の「ギャップ」に着目した新しいファインチューニング手法「GapFT」を提案している。Llama-3.1-8B を用いた実験において、LogiQA 2.0 で 14.4 ポイント、ReClor で 13.9 ポイントの Pass@1 精度向上を達成した。

関連研究

従来の検証済み応答を用いた事後学習レシピでは、最初のデコードですでに解けている問題と、K サンプル以内で回復した失敗を区別せずに扱ってきた。そのため、固定予算のもとでは、デプロイされたポリシーがすでに持っている振る舞いを繰り返すことにデータが消費されるという課題があった。

新規性と貢献

GapFT の最大の貢献は、ポリシーが 1 サンプルでは失敗するが K サンプル以内で解決できる問題(Pass@K と Pass@1 のギャップ)に学習データを絞り込む点にある。これにより、全検証プールを用いたファインチューニングと比較して 3 分の 1 のデータ量で同等の性能を実現し、予算をマッチさせた一様な検証済み RFT(Reward Fine-Tuning)を上回る成果を挙げた。

提案手法の詳細

GapFT は、ソースチェックポイントのシングルサンプルでの結果を基準に学習データを選択する。具体的には、ポリシーが 1 回の試行で間違え、かつ K 回以内の試行で正解にたどり着いた「回復された失敗」の事例を学習予算に充てる。これにより、すでに獲得済みの能力の反復学習を避け、モデルが獲得途上の推移的な推論能力を集中的に学習できる仕組みとなっている。

評価・考察

Llama-3.1-8B および Qwen2.5-7B(3 シードでのレプリケーション)を用いた評価で、LogiQA 2.0 や ReClor などの論理推論タスクにおいて一貫した精度向上が確認された。Llama-3.1-8B では Pass@1 が LogiQA 2.0 で 14.4pt、ReClor で 13.9pt 向上し、シングルサンプルのデコード結果がソースモデルのベリファイア選択による Pass@4 の精度に匹敵することを示した。また、ランダム化対照実験により、この性能向上が明確に「異なる失敗事例のカバー」に起因していることが裏付けられている。

応用例と今後の展望

本手法は、推論能力を重視する LLM の事後学習パイプライン全般に応用可能である。特に、金融や医療などの高度な論理推論が求められる分野のドメイン適応において、限られた計算資源・アノテーションコストで効率的にモデルの単一推論精度を引き上げるための基盤技術として実務的なインパクトを持つ。今後の課題としては、より多様なタスクや大規模モデルにおけるスケーラビリティの検証が挙げられる。

結論

Pass@K と Pass@1 の乖離という明確な指標に基づいたデータ選択手法 GapFT は、LLM の推論能力向上におけるデータ効率のボトルネックを解消する有力なアプローチであることを示した。

注釈

  • RLVR (Reinforcement Learning from Verifiable Rewards): 数学やコードなど、正誤がプログラム等で自動判定できる環境を利用した強化学習手法。
  • Pass@K: 生成された K 個の出力の中に少なくとも 1 つの正解が含まれる確率。