📜 papers

2026-09-22 · 5 topics

3B 未満の SLM における不確実性推定の限界と意味論的エントロピーによる精度改善

🔥🔥

トークン単位のエントロピーが機能しないことを示し、意味論的エントロピーを用いた選択的ルーティングにより最大 50pt の精度向上を実証。

MLLM の安全性を 4 次元で評価するベンチマーク MME-Safety──17 モデルの検証で脆弱性を解明

🔥🔥

リスクシナリオやモダリティ別の隠蔽度を含む 4 次元アノテーションスキーマにより、17 の SOTA MLLM の安全性プロファイルを網羅的に評価した。

KV キャッシュをスパース化する長文脈推論手法 Elastic Threshold Attention──デコード速度最大 2.5 倍を実証

🔥🔥

動的な文脈しきい値予測と乗算型ロジット抑制により、1.45B モデルで密注意力と同等の品質を維持しつつアクティブデコード密度 38% を達成。

多言語 LLM の知識消去を検証するベンチマーク μ^2-Bench──訓練・ホールドアウト言語を網羅した評価フレームワークを提案

🔥🔥

多言語大規模言語モデルの機械消去における知識の拡散と消去漏れを検証するため、複数言語をまたぐ完全なパイプライン評価を実現した μ^2-Bench を提案する。

全二重音声エージェント Voice-Light──因果的ターンテイキングと推論先読みにより 758 ms の応答遅延を達成

🔥🔥

ストリーミングASRと因果的アダプターを統合し、VADエンドポイントから初動サーバー音声まで中央値 758 ms を実現した全二重音声エージェント手法。