2026-07-26 · 13 topics
Anthropic、LLM「Claude Opus 5」を公開──Fable 5 相当の性能を半額で提供し安全性評価を緩和
🔥🔥🔥Claude Opus 4.8 の後継として API 価格を入力 100 万トークンあたり 5 ドルに半減させ、推論時の努力度パラメータ調整や自動フォールバック機能を実装した。
Anthropic、モデル Claude Opus 5 を発表──ARC-AGI-3 スコアを 3 倍に向上し半額で提供
🔥🔥🔥Anthropic がコードネーム Honeycomb と呼ばれた Claude Opus 5 を公開し、上位モデル Fable 5 に迫る推論能力を前モデルと同額の $5/$25 で実現した。
ARC-AGI-3 Leaderboard 公開──AI エージェントの適応能力と推論効率を可視化
🔥🔥静的な知能評価から動的な環境適応へシフトし、推論コストと性能の相関を $10,000 以下の予算制限下で比較可能にした。
Anthropic、Opus 5 のプロンプトインジェクション耐性を強化──System Card で実証
🔥🔥Anthropic のエンジニア Boris Cherny 氏が、最新モデル Opus 5 におけるプロンプトインジェクション耐性の向上を明言。
slvDev、28.9M パラメータ LLM を $8 のマイクロコントローラ ESP32-S3 で稼働させるアーキテクチャを公開──Per-Layer Embeddings の応用で毎秒 9 トークンを達成
🔥🔥フラッシュメモリと SRAM の階層管理により、従来モデル比約 100 倍規模の 28.9M パラメータ LLM をオフラインで動作させることに成功した。
Allen AI、AI 研究における「完全オープン」の重要性を提唱──Olmo モデルの全資産公開による検証可能性を強調
🔥🔥モデルの重みだけでなく、学習データ・コード・チェックポイント・評価手法を公開することで、ブラックボックス化する AI の信頼性と科学的再現性を担保する。
Kwaipilot、エージェント特化型モデル KAT-Coder-V2.5-Dev を公開──35B規模でSOTAを達成
🔥🔥Qwen3.6-35B-A3BをベースにSFTと強化学習を実施し、異常なツール呼び出しや連続重複を大幅に抑制したエージェント向けオープンウェイトモデル。
DavidAU、Qwen3.6-27B ベースのファインチューンモデルを公開──ARC-C で 0.711 を記録
🔥🔥27B クラスで初めて ARC-C ベンチマーク 700 点台に到達し、クローズドモデルに迫る推論性能をコンシューマー GPU で実現した。
OpenBMB、ロボット制御モデル MiniCPM-RobotManip を公開──1.5B パラメータで長文脈視覚記憶を実現
🔥🔥1.5B パラメータの視覚言語行動モデルでありながら、ストリーミング推論による最大60フレームの視覚記憶と120msの高速な意思決定ステップを実現した。
Motif Technologies、MoE モデル Motif-3 Beta を公開──314B パラメータで 256K コンテキストに対応
🔥🔥既存アーキテクチャの流用ではない独自設計の MoE を採用し、Artificial Analysis Intelligence Index で 44 を記録した。
poolside、推論特化モデル Laguna-S-2.1 を公開──118B MoE と 1M コンテキストでエージェント開発を最適化
🔥🔥総パラメータ数 118B の Mixture-of-Experts アーキテクチャを採用し、1M トークンの長文脈とツール間のインターリーブ思考をネイティブサポートするエージェントコーディング向けモデル。
Upstage、オープンモデル Solar-Open2-250B を公開──250B規模で実効15BのMoEと1Mトークン長文脈を実現
🔥🔥250Bパラメータ・アクティブ15BのMoE構造とハイブリッドアテンションを採用し、1Mトークン長文脈と最小限の推論コストを両立したエージェント向け大規模言語モデル。
Nanbeige、Looped Transformer 採用の 3B エージェントモデル Nanbeige4.2-3B を公開──Qwen3.5-9B を凌駕
🔥3B の非埋め込みパラメータ数ながら Looped Transformer によりモデル容量を拡張し、ツール利用やコード生成ベンチマークで上位モデルを上回る。