📜 papers

2026-10-07 · 5 topics

映像と音声を同時に生成する基盤モデル Kandinsky 6.0 Video──3B/29B の 2 モデルを公開

🔥🔥

テキストや画像から 5 秒間の Full-HD 映像と同期した 44 kHz 音声を生成するデュアルストリーム CrossDiT モデルを提案し、人間評価で優れた音声品質を実証した。

Base Model の推論能力を引き出す開始トークンキュー──MATH-500 で 36pt 向上を実証

🔥🔥

特定の開始トークンを固定することで、ベースモデルが強化学習済みモデルと同等の推論性能を発揮することを突き止め、その機構がトレーニングデータに起因することを解明した。

LLM エージェントの記憶依存による迎合を防ぐフレームワーク MemAdapter──客観的推論を実現する Counterfactual Induction 手法

🔥

長期記憶の不適切な影響をカウンターファクチュアル推論と自己内省で補正し、客観的な証拠に基づく信頼性の高い応答を実現する MemAdapter を提案する。

LLM の自動研究により構築された分子緩和オプティマイザ AutoSella──Sella 比でフォースコール数を最大 40.2% まで削減

🔥

エージェントがオプティマイザコードを自動書き換えする autoresearch 手法により、密度汎関数理論レベルの計算において Sella 比で 40.2%〜77.2% のフォースコール数で同等のエネルギー収束を達成した。

固定点解析に基づく Looped LLM の効率化手法──KV キャッシュ 3 分の 1 で同等精度を実証

🔥

リカレント状態の固定点収束を活用した学習済み事前分布と直交入力射影により、1.6B モデルで KV キャッシュを 1/3 に削減しつつ下流タスクの精度を維持した。