📜 papers

2026-09-13 · 5 topics

8B-MoT 統合マルチモーダルモデル SenseNova-U1.5──エンコーダ/VAE 非依存で 4K 解像度と多様な視覚タスクを実現

🔥🔥

SenseNova-U1.5 は、エンコーダおよび VAE を排した 8B-MoT のネイティブ統合視覚モデルであり、最大 4K 解像度での生成・編集やマルチエキスパート蒸留による高い画像忠実度とテキスト描画性能を達成した。

次概念予測により学習効率を大幅に高めた潜在空間言語モデル NCP-ArchPreview

🔥🔥

隠れ状態から構築した量子化概念ボキャブラリによる Next Concept Prediction を導入し、OLMo-3-7B 比で学習トークン数を 51.3% に抑えつつ同等の損失を達成した。

音声生成と編集を統合したオープンソース基盤モデル AuK──30億の指示音声データと4ステップ推論で高速化を実現

🔥🔥

自然言語指示と音声コンテキストにより音声生成や編集など5タスクを統合し、モデル蒸留により4ステップ推論での高速化を達成した。

マルチモーダル対話モデル Gander──Cerebellum-Brain 構造によるリアルタイム全二重エージェントを実現

🔥🔥

ビデオ・音声・テキストのストリーミング入力を統合し、常時割り込み可能な全二重インタラクションと高度な推論を両立したエンドツーエンドモデル Gander の設計手法。

大規模強化学習の全工程を統合するプロダクション向け学習システム Miles v0.1──64基の NVIDIA GB300 を用いた大規模エージェント型 RL の実装を公開

🔥🔥

SGLang ベースのロールアウトエンジンと複数のバックエンドを統合し、大規模な強化学習や LoRA RL、ディフュージョンモデルの学習を実用的なスケーラビリティで実現する。