📜 papers
2026-07-24 · 5 topics
Apple M5 Neural Accelerator対応推論ランタイムBaseRT──llama.cpp比最大6.4倍のスループットを実現
🔥🔥Apple M5の専用Neural Acceleratorを直接活用するMetal 4カーネルにより、プロンプト処理で最大6.4倍、デコードで最大1.75倍の高速化を達成した。
SLPO:潜在推論に強化学習を導入しテスト時スケーリングを実現する手法
🔥🔥潜在推論モデルに対し、代理ポリシーによる報酬割り当てと停止判断ヘッドを導入することで、計算リソースを動的に配分しPass@kを改善した。
金融感情分析のコストを削減するマルチエージェント手法TriAgent──GPT-4o-mini比で年間930万ドルのコスト削減
🔥🔥文脈粒度の異なるエージェント間の意見不一致を指標化し、適切なモデルへルーティングすることで、精度を維持しつつ推論コストを最適化する。
LRMの推論を最適化するEvoThink──冗長ステップの剪定と失敗からの学習で効率と精度を両立
🔥🔥推論軌跡を原子ユニットに分解し、冗長な検証ステップを剪定するSPTと、失敗から正解を導くAha-Moment Preference Optimizationにより、トークン消費を抑えつつ推論能力を向上させた。
250B MoEモデルSolar Open 2を公開──1Mトークン長文脈とエージェント特化学習で性能向上
🔥🔥1Mトークンのコンテキスト窓とMulti-teacher On-Policy Distillationにより、同規模のオープンウェイトモデルを凌駕するエージェント性能を実現した。