🧠 research

2026-07-31 · 8 topics

Google DeepMind、モデル群 Gemini Robotics 2 を公開──全身制御とマルチロボット協調を実現

🔥🔥🔥

足先から指先までの全身を単一モデルで制御し、数時間のデモ学習で新ハードウェアに適応するロボティクス基盤。

Google DeepMind、Gemini Robotics ER 2 を公開──動画理解とマルチロボット協調を強化

🔥🔥🔥

連続動画フィードのリアルタイム解析により進捗追跡とツールオーケストレーションを高速化し、ロボットの高度な自律制御を実現した。

Thinking Machines、学習モデル Inkling-Small を公開──276Bパラメータで教師モデルを超える推論精度を達成

🔥🔥

Mira Murati 氏率いる Thinking Machines Lab が 276B 構成の MoE モデル Inkling-Small を公開し、オンポリシー蒸留により推論コストを 1/4 に抑えつつ上位モデルの性能を上回った。

Microsoft Research、コンピュータ操作エージェント向け学習フレームワーク Echoverse を公開──12のシミュレーション環境で 9B モデルのスコアを 67.1% へ倍増

🔥🔥

データベース状態を維持する 12 の高忠実度ドメイン・能力環境を構築し、強化学習ループの共進化によりエージェントのタスク完遂力を大幅に引き上げた。

Goodfire、Qwen3-35B の飲酒運転容認挙動を特定──内部ニューロン直接制御で再学習なしに抑制

🔥🔥

Goodfire の解釈性プラットフォーム Silico を用いて Qwen3-35B 内の競合ニューロンを特定し、再学習なしに有害応答を抑制した。

Sarvam AI、音声認識モデル Saaras V4 を発表──多重発話の単一パス処理で 7 つのグローバル英語ベンチマークを統合

🔥🔥

ダイレクトなダイアライゼーションと ASR を単一パスで統合し、ElevenLabs Scribe v2 や Deepgram を凌駕するマルチスピーカー認識を実現した。

Exponential View、AI 導入の J カーブ構造を解説──成功と失敗を分ける 3 つの企業アーキタイプ

🔥🔥

巨額の AI 投資とリターンの間に生じるタイムラグの正体をモデル化し、形骸化した実験と持続的な学習プロセスの違いを分析した。

Sarvam AI、感情音声対応モデル Bulbul V4 を公開──11 種類のインド言語と 39 以上のボイスをサポート

🔥🔥

LLM ベースのプロソディエンジンによりイントネーションや感情表現を最適化し、ElevenLabs を超える自然な音声合成を実装した。