📜 papers

2026-07-30 · 5 topics

LLM-as-a-Judgeの判定ロジックをプログラムに蒸留するPAJAMA──コストを削除し13Bモデルと同等の精度を達成

🔥🔥

LLMの評価ロジックをプログラムの委員会に蒸留することで、APIコストを削減しつつ13B規模のLLM-as-a-Judgeと同等の評価精度を実現した。

エンタープライズ向けコードエージェント手法 CRAFT──プロンプトのスキーマ依存を排除し、推論コストを 1/9 に削減

🔥🔥

プロンプトへの網羅的なスキーマ注入を排除する 2 段階のポストトレーニング手法により、コンポジット Agent Score を 9.6 pp 向上させつつ入力トークン量を 1/9 に圧縮した。

視覚トークン圧縮が MLLM の頑健性を高める──ジェイルブレイク防御で平均 13.29pt 向上を実証

🔥🔥

視覚言語モダリティの不整合を原因と捉え、言語特徴空間から乖離した OOD トークンをプルーニングすることで、推論コスト削減と安全性の両立に成功した。

LLM アライメントデータ監査手法── Shapley 値の推論ベース近似で HelpSteer2 の監査範囲を 99.1% 削減

🔥🔥

推論時の条件付き対数尤度シフトからデータの予測影響度を算出し、既存手法で検出困難なアライメント用データの構造的矛盾や誤ラベルを効率的に特定する。

Unified-Memory Apple Silicon における CPU+GPU 協調実行機構 FusionML──Llama 型プリフィルを 1.15〜1.38 倍に高速化

🔥🔥

Apple Silicon の統一メモリを活用し、遅延グラフスケジューラの制約を回避したレイヤー単位の行分割により、Qwen2.5-7B の TTFT を最大 1.25 倍に高速化。