🧠 research

2026-07-26 · 13 topics

Anthropic、LLM「Claude Opus 5」を公開──Fable 5 相当の性能を半額で提供し安全性評価を緩和

🔥🔥🔥

Claude Opus 4.8 の後継として API 価格を入力 100 万トークンあたり 5 ドルに半減させ、推論時の努力度パラメータ調整や自動フォールバック機能を実装した。

Anthropic、モデル Claude Opus 5 を発表──ARC-AGI-3 スコアを 3 倍に向上し半額で提供

🔥🔥🔥

Anthropic がコードネーム Honeycomb と呼ばれた Claude Opus 5 を公開し、上位モデル Fable 5 に迫る推論能力を前モデルと同額の $5/$25 で実現した。

ARC-AGI-3 Leaderboard 公開──AI エージェントの適応能力と推論効率を可視化

🔥🔥

静的な知能評価から動的な環境適応へシフトし、推論コストと性能の相関を $10,000 以下の予算制限下で比較可能にした。

Anthropic、Opus 5 のプロンプトインジェクション耐性を強化──System Card で実証

🔥🔥

Anthropic のエンジニア Boris Cherny 氏が、最新モデル Opus 5 におけるプロンプトインジェクション耐性の向上を明言。

slvDev、28.9M パラメータ LLM を $8 のマイクロコントローラ ESP32-S3 で稼働させるアーキテクチャを公開──Per-Layer Embeddings の応用で毎秒 9 トークンを達成

🔥🔥

フラッシュメモリと SRAM の階層管理により、従来モデル比約 100 倍規模の 28.9M パラメータ LLM をオフラインで動作させることに成功した。

Allen AI、AI 研究における「完全オープン」の重要性を提唱──Olmo モデルの全資産公開による検証可能性を強調

🔥🔥

モデルの重みだけでなく、学習データ・コード・チェックポイント・評価手法を公開することで、ブラックボックス化する AI の信頼性と科学的再現性を担保する。

Kwaipilot、エージェント特化型モデル KAT-Coder-V2.5-Dev を公開──35B規模でSOTAを達成

🔥🔥

Qwen3.6-35B-A3BをベースにSFTと強化学習を実施し、異常なツール呼び出しや連続重複を大幅に抑制したエージェント向けオープンウェイトモデル。

DavidAU、Qwen3.6-27B ベースのファインチューンモデルを公開──ARC-C で 0.711 を記録

🔥🔥

27B クラスで初めて ARC-C ベンチマーク 700 点台に到達し、クローズドモデルに迫る推論性能をコンシューマー GPU で実現した。

OpenBMB、ロボット制御モデル MiniCPM-RobotManip を公開──1.5B パラメータで長文脈視覚記憶を実現

🔥🔥

1.5B パラメータの視覚言語行動モデルでありながら、ストリーミング推論による最大60フレームの視覚記憶と120msの高速な意思決定ステップを実現した。

Motif Technologies、MoE モデル Motif-3 Beta を公開──314B パラメータで 256K コンテキストに対応

🔥🔥

既存アーキテクチャの流用ではない独自設計の MoE を採用し、Artificial Analysis Intelligence Index で 44 を記録した。

poolside、推論特化モデル Laguna-S-2.1 を公開──118B MoE と 1M コンテキストでエージェント開発を最適化

🔥🔥

総パラメータ数 118B の Mixture-of-Experts アーキテクチャを採用し、1M トークンの長文脈とツール間のインターリーブ思考をネイティブサポートするエージェントコーディング向けモデル。

Upstage、オープンモデル Solar-Open2-250B を公開──250B規模で実効15BのMoEと1Mトークン長文脈を実現

🔥🔥

250Bパラメータ・アクティブ15BのMoE構造とハイブリッドアテンションを採用し、1Mトークン長文脈と最小限の推論コストを両立したエージェント向け大規模言語モデル。

Nanbeige、Looped Transformer 採用の 3B エージェントモデル Nanbeige4.2-3B を公開──Qwen3.5-9B を凌駕

🔥

3B の非埋め込みパラメータ数ながら Looped Transformer によりモデル容量を拡張し、ツール利用やコード生成ベンチマークで上位モデルを上回る。