📜 papers

2026-07-24 · 5 topics

Apple M5 Neural Accelerator対応推論ランタイムBaseRT──llama.cpp比最大6.4倍のスループットを実現

🔥🔥

Apple M5の専用Neural Acceleratorを直接活用するMetal 4カーネルにより、プロンプト処理で最大6.4倍、デコードで最大1.75倍の高速化を達成した。

SLPO:潜在推論に強化学習を導入しテスト時スケーリングを実現する手法

🔥🔥

潜在推論モデルに対し、代理ポリシーによる報酬割り当てと停止判断ヘッドを導入することで、計算リソースを動的に配分しPass@kを改善した。

金融感情分析のコストを削減するマルチエージェント手法TriAgent──GPT-4o-mini比で年間930万ドルのコスト削減

🔥🔥

文脈粒度の異なるエージェント間の意見不一致を指標化し、適切なモデルへルーティングすることで、精度を維持しつつ推論コストを最適化する。

LRMの推論を最適化するEvoThink──冗長ステップの剪定と失敗からの学習で効率と精度を両立

🔥🔥

推論軌跡を原子ユニットに分解し、冗長な検証ステップを剪定するSPTと、失敗から正解を導くAha-Moment Preference Optimizationにより、トークン消費を抑えつつ推論能力を向上させた。

250B MoEモデルSolar Open 2を公開──1Mトークン長文脈とエージェント特化学習で性能向上

🔥🔥

1Mトークンのコンテキスト窓とMulti-teacher On-Policy Distillationにより、同規模のオープンウェイトモデルを凌駕するエージェント性能を実現した。