予測された情報ニーズに基づき文書を動的に分割する Intent-Driven Dynamic Chunking を提案──検索精度を最大 67% 向上
LLM と動的計画法を活用しユーザーの意図に沿った文書分割を行うことで、トップ 1 検索精度を 5% から 67% 向上させつつチャンク数を 40〜60% 削減した。
リリース: 2026-02-16 · 読了 5 分論文概要
本研究では、情報検索や RAG (Retrieval-Augmented Generation) における文書分割の課題を解決する新規手法「Intent-Driven Dynamic Chunking (IDC)」が提案された。従来の固定長分割やコヒーレンスベースの分割手法ではユーザーの検索意図が無視され、回答が分断されたりノイズが混入したりするという問題があった。IDC は、LLMを用いて文書に対する想定ユーザー意図(クエリ)を生成させ、動的計画法(Dynamic Programming)を用いてグローバルに最適なチャンク境界を探索する手法である。6つの多様な質問応答データセットを用いた評価において、IDC は 5 つのデータセットで従来手法を上回り、トップ 1 検索精度(Top-1 Retrieval Accuracy)を 5% から 67% 向上させ、さらにチャンク数を 40〜60% 削減しながら 93〜100% の回答カバー率を達成した。
関連研究
文書の分割手法としては、伝統的に文字数やトークン数に基づく固定長チャンキングや、文間の意味的類似度(コヒーレンス)を利用した動的セグメンテーションが用いられてきた。しかし、これらは検索時における「ユーザーがどのような情報を求めているか」というインテントを考慮しないため、情報の分断や冗長なコンテキストの混入を招いていた。本研究は、予測された情報ニーズを直接セグメンテーションの最適化に組み込むという点で従来手法と一線を画す。
新規性と貢献
本研究の主要な貢献は、検索システムの下流タスクであるインテント(意図)を上流の文書分割プロセスにフィードバックする動的フレームワークの構築にある。LLM が生成したインテント予測に基づき、貪欲法の罠を回避する大域的な動的計画法で最適な分割点を決定するアプローチは、長文や異質な構造を持つ文書において極めて効果的であることが示された。

評価・考察
ニュース記事、Wikipedia、学術論文、技術文書を含む6つの質問応答データセットで検証が行われた結果、IDC は 5 つのデータセットで既存の分割戦略を凌駕した。特に、トップ 1 検索精度において 5% から最大 67% の改善が確認されている。また、図 2 および図 3 に示されるように、従来のベースライン手法と比較してチャンク生成数を 40〜60% 削減したにもかかわらず、単一チャンク内に正解が含まれる回答カバー率は 93〜100% を維持している。

応用例と今後の展望
法的文書や大規模な技術マニュアルを取り扱う国内の企業向け RAG システムにおいて、コンテキスト長制限の効率化と検索精度の両立に直結する。特に、数万トークン規模の社内文書データベースを持つ金融・製造業のドキュメント検索基盤において、検索ノイズの低減とコスト削減(トークン数の圧縮)を同時に達成する実務インパクトが期待される。今後の課題としては、LLM によるインテント生成コストと分割処理のレイテンシを実際の運用環境でどこまで許容できるかの検証が挙げられる。
結論
文書構造をあらかじめ予測される情報ニーズに適合させる Intent-Driven Dynamic Chunking は、RAG や検索エンジンの検索精度を飛躍的に高めつつストレージおよびコンテキスト消費量を抑制する極めて強力な手法である。
注釈
- RAG (Retrieval-Augmented Generation): 外部のデータベースから検索した関連情報をプロンプトに付加し、LLM の生成精度を向上させる技術。
- 動的計画法 (Dynamic Programming): 複雑な問題を小さな部分問題に分割して解くことで、効率的に大域的最適解を求めるアルゴリズム。