📜 papers

2026-10-05 · 5 topics

Transformer はなぜ思考を早々に打ち切るのか──層の凍結とランク 8 LoRA による長文脈チェーン計算の拡張

🔥🔥

事前学習済み Transformer が文脈参照の追従に層の深さをほとんど活用していない問題に対し、1つの早期レイヤーにランク8のLoRAを適用して計算の継続とリレー機構を引き起こす手法を提案し、Qwen3-8Bの24行チェーン精度を15.5%から99%へ改善した。

より小さな凍結モデルが強力な選好リジェクトを生成──コード・数学推論タスクでの検証

🔥🔥

7Bから72Bまでのモデルを用いた検証により、小規模モデルから生成されたリジェクトが効率的な推論コストで優れた生徒モデルを育成できることを実証した。

ストリーミング動画対話の知覚・記憶・応答を統合する 4B モデル OneStreamer ── 8 つの評価ベンチマークで最高性能を達成

🔥

プロアクティブ階層型キャプションメモリと状態遷移学習により、リアルタイム知覚を損なうことなく再利用可能な事実的メモリを形成し、既存手法を凌駕する性能を実現した。

LLM の事後学習における探索能力低下を定量化する Sharpening Tax と適応型サンプリング手法 PTGS

🔥

強化学習による事後学習がモデルの解法網羅性を低下させる現象を Sharpening Tax として定量化し、テスト時計算の効率を改善する適応型サンプリング手法 PTGS を提案する。

長期エージェント向け推論時フレームワーク PoS──明示的な信念状態の維持により 4 つのベンチマークですべて最高性能を達成

🔥

LLM エージェントのコンテキスト管理において、現在の世界状態と未解決のタスク要件を統合した明示的な信念状態を構築・維持する PoS フレームワークを提案し、すべてのバックボーンとベンチマークで最高性能を実証した。