2026-07-31 · 8 topics
Google DeepMind、モデル群 Gemini Robotics 2 を公開──全身制御とマルチロボット協調を実現
🔥🔥🔥足先から指先までの全身を単一モデルで制御し、数時間のデモ学習で新ハードウェアに適応するロボティクス基盤。
Google DeepMind、Gemini Robotics ER 2 を公開──動画理解とマルチロボット協調を強化
🔥🔥🔥連続動画フィードのリアルタイム解析により進捗追跡とツールオーケストレーションを高速化し、ロボットの高度な自律制御を実現した。
Thinking Machines、学習モデル Inkling-Small を公開──276Bパラメータで教師モデルを超える推論精度を達成
🔥🔥Mira Murati 氏率いる Thinking Machines Lab が 276B 構成の MoE モデル Inkling-Small を公開し、オンポリシー蒸留により推論コストを 1/4 に抑えつつ上位モデルの性能を上回った。
Microsoft Research、コンピュータ操作エージェント向け学習フレームワーク Echoverse を公開──12のシミュレーション環境で 9B モデルのスコアを 67.1% へ倍増
🔥🔥データベース状態を維持する 12 の高忠実度ドメイン・能力環境を構築し、強化学習ループの共進化によりエージェントのタスク完遂力を大幅に引き上げた。
Goodfire、Qwen3-35B の飲酒運転容認挙動を特定──内部ニューロン直接制御で再学習なしに抑制
🔥🔥Goodfire の解釈性プラットフォーム Silico を用いて Qwen3-35B 内の競合ニューロンを特定し、再学習なしに有害応答を抑制した。
Sarvam AI、音声認識モデル Saaras V4 を発表──多重発話の単一パス処理で 7 つのグローバル英語ベンチマークを統合
🔥🔥ダイレクトなダイアライゼーションと ASR を単一パスで統合し、ElevenLabs Scribe v2 や Deepgram を凌駕するマルチスピーカー認識を実現した。
Exponential View、AI 導入の J カーブ構造を解説──成功と失敗を分ける 3 つの企業アーキタイプ
🔥🔥巨額の AI 投資とリターンの間に生じるタイムラグの正体をモデル化し、形骸化した実験と持続的な学習プロセスの違いを分析した。
Sarvam AI、感情音声対応モデル Bulbul V4 を公開──11 種類のインド言語と 39 以上のボイスをサポート
🔥🔥LLM ベースのプロソディエンジンによりイントネーションや感情表現を最適化し、ElevenLabs を超える自然な音声合成を実装した。