📜 papers

2026-08-13 · 5 topics

フロンティア LLM のステアリング圧力下における応答モードの分岐評価と内部表現解析

🔥🔥

6 社のフロンティアモデルを対象に 24,480 件の判断を分析し、モデルごとに異なる応答モードの分岐と内部残留ストリームにおける線形プローブによる 0.87 の高精度な解読を実証した。

2万件超のプロファイルから最適エージェントを動的取得する LLM Agents Factory

🔥🔥

2万件以上の事前定義済みエージェントプロファイルをセマンティック検索で取得・蒸留し、AutoGenと同等の生成品質を低コストで実現する。

LLM チャットエージェント向け三層ドーフドッグ評価フレームワーク──目標指向 NPC シミュレーションでコストを 6,272 分の 1 に削減

🔥🔥

標準的な質問バンクから目標指向型 NPC シミュレーションまでの三層評価により、単体精度では検知できない対話の失敗を自動検出し、CI/CD への組み込みを実現した。

エッジ向け SLM の 4-bit 量子化が多言語処理に与える構造的崩壊とタイポロジカル脆弱性を実証

🔥🔥

Gemma 4 と Qwen 3.5 の 4-bit 量子化におけるゼロショット多言語評価から、低リソース言語で代表表現の崩壊が起きる量子化税の構造的偏りを解明した。

LLM の Chain-of-Thought の限界を解明──シリアル深度に依存する計算ボトルネックと +64pt 改善の境界

🔥🔥

Chain-of-Thought は万能の汎用強化策ではなくバンド幅バイパスであり、高深度タスクで +54〜+68 pp の改善を示す一方、モデルサイズや深度によっては逆効果になることを実証。