📜 papers

2026-09-14 · 5 topics

総パラメータ数 122B の MoE モデル T1 を強化学習で訓練、Terminal-Bench 2.1 で 64.0% の解決率を達成

🔥🔥

クラウドサンドボックス上のリアルシェルで 300 ターン以上の長文脈タスクをこなす T1 モデルを提案し、Terminal-Bench 2.1 で 64.0% を記録。

音声 Speech LLM のオーディオエンコーダを圧縮する X-AuT──18 層から 16 層への削減でマクロ平均エラー率を 5.61% から 5.27% に改善

🔥🔥

クロススケール蒸留とプログレッシブプルーニングにより、Speech LLM の音声エンコーダのパラメータ数を 20.7% 削減しつつ精度を向上させた。

LLM の自己改善を最適化する Negative Self-Distillation 手法──誤った推論の回避により推論性能を向上

🔥🔥

正解の模倣を強制する従来の自己蒸留が持つ探索的行動の抑制を解消し、動的ゲーティング機構により基礎的な言語能力を保持しつつ推論性能を改善する新フレームワーク。

トランジットキオスク向け LLM 評価ベンチマーク MetroLLM-Bench 公開──4B モデルが GPT-5 級を凌駕

🔥🔥

6 つの都市鉄道網と 955 ケースの検証により、2.6GB の 4B PEFT モデルが Tier 1 スコアで GPT-5.6 を上回る性能を実証した。

多言語推論を促進するデータミックス手法──Tiny Aya L2-Thinker で 60 言語以上の L2 推論率 93% を達成

🔥🔥

SFT のデータ構成とスケジューリングの最適化により、英語以外のプロンプトに対しても一貫してターゲット言語で推論を行う L2 推論を実現した。