📜 papers

2026-09-01 · 5 topics

出力層射影を HNSW で近似する LLM 推論高速化手法──Gemma 3 270M でデコードスループットを 82% 向上

🔥🔥

出力層の全語彙射影をベクトルインデックスによる最大内積探索に置き換え、メモリ帯域ボトルネックを解消しつつ生成品質を維持した。

量子化がトリガーとなる LLM バックドア攻撃手法──FP16 検証済みモデルが INT8/4-bit 圧縮で最大 85% の挙動逆転を示すことを実証

🔥🔥

ポストトレーニング量子化の検証・デプロイ間ギャップを突き、フル精度チェックを通過しながら量子化後に悪性挙動を誘発する 3 段階の敵対的ファインチューニングフレームワークを提案。

金融資格試験ベンチマーク FinExam-10K 公開──CFA/FRM対応の10,198問で最高精度 85.29%

🔥🔥

CFA Levels I-III と FRM Parts I-II を網羅する 10,198 問の金融推論ベンチマーク FinExam-10K を公開し、17 モデルの評価から RAG 適用における課題と選択的ゲート手法の有効性を実証した。

LLM エージェント社会の人間行動適合性を検証する新ツール SILICA ── 12 モデル評価で最終協力状態の再現に全モデルが失敗

🔥🔥

LLM エージェント社会の人間行動との一致度を検証する open instrument である SILICA を提案し、12 モデルの評価から初期状態以外の協力ダイナミクス再現の限界を実証した。

T2I モデルの数量把握の限界を暴く 64 万プロンプトのベンチマーク NumBench と評価指標 cw-NPS の提案

🔥🔥

64万件のプロンプトと因子設計を持つ NumBench により、既存の商用・オープンソースを含む全 T2I モデルが 50 個以上のオブジェクト生成で深刻な精度低下を引き起こすことを実証した。