📜 papers

2026-09-09 · 5 topics

エージェントの実行軌跡から大規模な検証環境を自動構築する Terminal-Universe──Terminal-Bench 2.1 で 11.9pt 向上を実証

🔥🔥

コードエージェントの軌跡におけるファイル操作の再生と補完により 37.3k のタスク環境を自動生成し、Qwen3.5-27B のファインチューニングで性能を大幅に改善した。

LLMの自己回帰生成を並列化する拡散モデル基盤 Uno──ベースモデル比最大 3 倍の高速化と精度維持を両立

🔥🔥

自己回帰モデルの重みと軽量な拡散モデルの重みを分離し、Diffusion Distillation により精度劣化なしで最大 3 倍の推論高速化を実現した。

LLM のオンポリシー蒸留における学習データの役割の再検証──1つのクエリでフルデータ学習のゲインの大半を回復

🔥🔥

オンポリシー蒸留において、たった 1 つのクエリでの学習が数百ステップにわたり精度向上を続け、フルデータ蒸留のゲインの大半を達成することを実証した。

検証器の報酬で自己指導を較正する LLM 向け学習手法 FlowBalance──数学推論で FlowRL 比の性能向上と応答長崩壊の回避を実証

🔥🔥

オンポリシー生成体験におけるトークンレベルの自己指導を検証器のグループアドバンテージで符号ゲーティングし、応答長崩壊を起こさずに数学的推論能力を向上させる手法。

ハイブリッド型 27B LLM のリカレント層を NVFP4 W4A4 化する Gated DeltaNet の量子化耐性を解明

🔥🔥

Qwen3.8-27B の全線形層を NVFP4 W4A4 化する Minima を構築し、BF16 精度を維持しつつ 17.5 GiB への軽量化と 14-19% のプレフィル高速化を実証した。