📜 papers
2026-07-23 · 5 topics
AIの権力追求行動を測定するベンチマーク「SysAdmin」公開──7つのフロンティアモデルで検証
🔥🔥Linux環境で自律的なシステム管理タスクを実行させ、権力追求行動を5つの指標で評価。現行モデルの発生率は最大5%以下と低水準であることを実証した。
Attention-only Transformerの性能検証──FFNなしでもパラメータ再配分で同等性能を実現
🔥🔥FFN層を除去したSimple Attention Networksを標準Transformerと厳密に比較し、パラメータをAttention深さに再配分することで損失差を0.27%まで縮小した。
LLMのドメイン横断推論を評価するRelay-Bench公開──GPT-5.5 (xHigh) のスコアは43.3%
🔥🔥2〜13のサブ問題を連結した複合タスクでLLMの推論能力を測定し、既存モデルの限界を浮き彫りにした。
LLMのJSON出力強制が回答多様性を低下──44モデルでモード回答率が41%から64%へ上昇
🔥🔥JSON形式の要求だけで回答の驚き度が1.80から1.58 bitsへ低下し、モデルが学習データ内の特定の回答形式に収束する現象を実証した。
8BモデルでKGQAを実現するSearch-on-Graph-R1──SPARQL教師学習で推論コストを削減
🔥🔥SPARQLクエリを用いた強化学習により、8Bモデルで既存の巨大LLMベースのKGQAシステムを上回る精度を達成した。