2026-09-07 · 5 topics
LLM 自らがアテンション先を動的制御する Declarative Attention ── KV キャッシュ読み取りを最大 52% 削減
🔥🔥モデル自身が Chain-of-Thought 内で注目領域を宣言する Declarative Attention プロトコルにより、15 の長文脈タスクで精度劣化を最小限に抑えつつアテンション済みトークン数を大幅に削減した。
会話履歴を連続メモリトークンに圧縮する LatentPress──LongMemEval で 7.70 倍圧縮時に精度 0.504 を達成
🔥🔥テキスト復元を伴わずに凍結デコーダへ直接入力する連続メモリトークンにより、従来比最大 16 倍の文脈圧縮と高速な推論を実現した。
VLM 基盤モデル Qwen-Drive-1.0 の提案──3D 認識とモーションプランニングを統合
🔥🔥既存の事前学習済み VLM の構造を維持しつつ、3D 認識や視覚的質問応答、モーションプランニングを単一の枠組みに統合して高度な自動運転性能を実現した。
SMELT: 中間層を 2 度巡回する MoE Looped Transformers でトレーニング FLOPs を最大 18% 削減
🔥🔥Looped Transformers の中間層を 2 度巡回させる SMELT レシピを提案し、計算量同等条件でトレーニング FLOPs を 6.8〜18.0% 削減した。
大規模動画生成モデルを対話型ワールドモデルに変換する H3-World──8,000 サンプルで正確なキャラクター・カメラ制御を実現
🔥🔥MiniMax-H3 をベースに、構造化された言語指示と時間的アテンションルーティングを導入することで、わずか 0.199% のパラメータ調整で精密なワールド制御を可能にした。