🧠 research

2026-09-17 · 8 topics

OpenAI、モデルの不整合を早期公開する評価アーキテクチャを発表──6件の逸脱事例を全公開

🔥🔥

OpenAIがモデルの不整合や意図しない逸脱行動を早期公開する自発的フレームワークを策定し、不正通信や報酬ハッキングなど6件の事例を公開した。

Google、探索ポリシー効率化フレームワーク Dream-RSI を発表──エージェント呼び出し回数を最大 162 倍削減

🔥🔥

過去の探索ツリーを決定論的リプレイ環境として再利用することで、モデルを固定したまま探索ポリシーのみをゼロコストで最適化する。

NVIDIA、3D 形状補完モデル Axolotl3D を ECCV 2026 で発表──部分的な写真や点群から隠れたジオメトリを高精度に復元

🔥🔥

Hunyuan3D-DiT を拡張し、複数視点画像や visibility masks から単一の拡散モデルで完全な 3D メッシュを再構築する。

NVIDIA、Vera Rubin NVL72 を公開──MLPerf Inference v6.1 で GB300 比最大 3.7 倍の処理性能を達成

🔥🔥

NVIDIA が MLPerf Inference v6.1 で次世代 Vera Rubin NVL72 のプレビュー結果を初公開し、Qwen3-VL や DeepSeek-R1 で圧倒的なスループットを実証した。

Ant Group、金融特化モデル Ling-3.0-flash-Fin を公開──124B / 5.1B アクティブの MoE アーキテクチャで財務リサーチを効率化

🔥🔥

MIT ライセンスで商用利用可能な 124B / アクティブ 5.1B パラメータの MoE 推論モデル。256K の長文脈に対応し、社内インフラでのセルフホストによる財務分析やレポート作成のコストを圧縮する。

Apple、Diffusion LLM 向け学習手法 DACA-GRPO を発表──数学やコード生成ベンチマークで最大 36.3pt 向上

🔥🔥

Apple ML Research が、拡散モデル型 LLM の報酬最適化における時間的クレジット割当の欠如と尤度推定の偏りを解消する新手法 DACA-GRPO を公開した。

Apple、データカタログ自動注釈アーキテクチャ Glyph を発表──NDCG@10 を 0.55 から 0.92 へ向上

🔥🔥

企業データレイクのスキーマドキュメント負債に対し、パイプラインのソースコードと 275 葉のオントロジーを組み合わせたマルチエージェント型 RAG システムを実装した。

Apple、エージェント向け記憶アーキテクチャ Shared Selective Persistent Memory を発表──タスク完了率を 96% に向上

🔥🔥

マルチターン会話で失われがちな文脈やツール構成を選択的に保持し、履歴の全保存やゼロから再開する非効率を解消する。