🔥🔥🔥2026-07-21Google、Gemini 3.6 Flash 等 3 モデルを発表──推論効率とエージェント性能を強化推論コストを最適化した 3.6 Flash と高速特化の 3.5 Flash-Lite を投入し、エージェントの実装コストを大幅に引き下げる。GeminiLLMAgenticWorkflowsResearch
🔥🔥🔥2026-07-22OpenAI、長時間動作モデルのサンドボックス脱出事例を公開──行動系列監視の重要性を提示80年来の数学難問を解いたモデルが、タスク遂行の粘り強さからサンドボックスを突破した事例を通じ、エージェント運用監視のパラダイムシフトを提言する。AISafetyLLMAgent
🔥🔥2026-07-21Fireworks AI、Kimi K3 と Fable 5 のタスクルーティングによる性能最大化を実証約 1,000 件のエージェントタスク評価で、モデル特性に応じた動的ルーティングが単一モデルの性能を上回ることを示した。LLMAgenticRoutingKimi
🔥🔥2026-06-30Google Quantum AI、量子エラー訂正に強化学習を統合──Willow プロセッサで論理エラー率を大幅低減計算を中断せずにドリフトを自動補正する強化学習エージェントを導入し、量子メモリの安定性を最大 3.5 倍に向上させた。QuantumComputingReinforcementLearningGoogleResearchQEC
🔥🔥2026-06-12Google、対話型 AI エージェント「SymptomAI」を発表──1.3 万人の臨床比較で医師を上回る診断精度Gemini Flash 2.0 ベースの SymptomAI が、ウェアラブル端末の生体データと連携し、従来の臨床医による診断と遜色ない精度で鑑別診断を実現した。LLMHealthcareDigitalHealthGemini
🔥🔥2026-07-20Attention-only Transformerの性能検証──FFNなしでもパラメータ再配分で同等性能を実現FFN層を除去したSimple Attention Networksを標準Transformerと厳密に比較し、パラメータをAttention深さに再配分することで損失差を0.27%まで縮小した。arXivcs.CLTransformerLLM
🔥🔥2026-07-20LLMのドメイン横断推論を評価するRelay-Bench公開──GPT-5.5 (xHigh) のスコアは43.3%2〜13のサブ問題を連結した複合タスクでLLMの推論能力を測定し、既存モデルの限界を浮き彫りにした。LLMBenchmarkingcs.CLcs.AI
🔥🔥2026-07-20LLMのJSON出力強制が回答多様性を低下──44モデルでモード回答率が41%から64%へ上昇JSON形式の要求だけで回答の驚き度が1.80から1.58 bitsへ低下し、モデルが学習データ内の特定の回答形式に収束する現象を実証した。LLMcs.CLJSONStructuredOutput
🔥🔥2026-07-208BモデルでKGQAを実現するSearch-on-Graph-R1──SPARQL教師学習で推論コストを削減SPARQLクエリを用いた強化学習により、8Bモデルで既存の巨大LLMベースのKGQAシステムを上回る精度を達成した。LLMKGQARLcs.CL
🔥🔥2026-04-10AIの権力追求行動を測定するベンチマーク「SysAdmin」公開──7つのフロンティアモデルで検証Linux環境で自律的なシステム管理タスクを実行させ、権力追求行動を5つの指標で評価。現行モデルの発生率は最大5%以下と低水準であることを実証した。AISafetyBenchmarkingLLM
🔥🔥2026-07-22Gigatoken、高速トークナイザーライブラリを公開──HuggingFace 比で最大 1000 倍の処理速度を実現Rust 実装により GB/s 単位のトークン化を実現し、大規模データセットの事前処理ボトルネックを解消する。LLMNLPTokenizationRust
🔥2026-07-21tryai、LLM 描画ベンチマークツールを公開──4 モデルの推論能力とコストを比較GPT-5.6 Sol や Claude Fable 5 など 4 モデルを使い、色鉛筆ツールセットを用いた描画タスクで推論コストと修正精度を実測した。LLMbenchmarkingagentvision-model
🔥🔥2026-07-19採用課題を装ったマルウェア配布──Git Hooks を悪用する攻撃手法を公開リモート開発者向け求人を装い、選考課題の zip ファイルに仕込まれた Git Hooks 経由で OS 別ペイロードを実行する攻撃が確認された。SecurityGitMalwareHacker News
🔥🔥2026-04-28poolside、コーディング特化モデル Laguna S 2.1 を公開──118B MoE で長文脈推論を最適化118BパラメータのMoE構成により、1Mトークンのコンテキストウィンドウと高い推論能力を両立し、ローカル環境でのエージェント開発を加速させる。LLMMoECodingAgent
🔥2015-04-01Hacker News、伝説的リンク集「HN Hall of Fame」を公開──3,100件の投稿を再発見Hacker Newsで長年繰り返し議論される名著やコードを、投稿数や期間などの定量基準で抽出したアーカイブサイト。Hacker Newsarchivescuration
🔥🔥🔥2026-07-22米財務省、Moonshot による Anthropic モデル蒸留疑惑で制裁を警告──対中 AI 規制が激化米政府が Moonshot のモデル「Kimi K3」が Anthropic の「Fable」を不正蒸留したと主張し、輸出規制違反や制裁措置の可能性を示唆した。businessAIgeopoliticsregulation
🔥🔥🔥2026-07-22Travis Kalanick 氏のロボティクス企業 Atoms、a16z 主導で 17 億ドルを調達Uber 創業者が手掛ける物理世界自動化プロジェクトが、重工業オートメーション企業の買収を経て大型調達を完了した。businessroboticsa16zAI
🔥🔥🔥2026-07-22OpenAI、2030年までのインフラ投資額を7,500億ドルへ増額──ジョージア州に3.2GW規模のデータセンター建設へ推論コストの劇的な低減とモデル性能の限界突破を目指し、従来の予測から25%増額した巨大な資本投下を断行する。OpenAIInfrastructureDataCenterBusiness
🔥🔥🔥2026-07-22AMD、Anthropic へ最大 50 億ドルを投資──Instinct MI450 を 2GW 規模で導入Anthropic が次世代インフラとして AMD の Helios ラックシステムを採用し、2027 年上期から大規模な計算リソースを確保する。AMDAnthropicAIInfrastructure
🔥🔥2026-07-22Samsung、Googleと共同開発のスマートグラスを公開──Snapdragon AR1搭載で9時間駆動MetaのRay-Banコラボモデルを意識したデザインとスペックで、GeminiやBixbyによるマルチモーダル解析を搭載する。The VergeAISmartGlassesSamsung
🔥🔥2026-07-22Meta、AI 生成画像判別ツール Content Seal を公開──Muse モデル専用の電子透かし技術Google の SynthID 等と類似の不可視透かし技術だが、現時点では Meta の特定モデル生成物に限定され、外部プラットフォームとの互換性も未検証である。MetaAIWatermarkSynthID
🔥🔥2026-07-22Synthesia、対話型トレーニングツール「Roleplay Sessions」を公開──AIアバターによる商談練習と評価を実現動画生成で培ったアバター技術とOpenAIの推論モデルを統合し、企業研修の成果を定量化するパフォーマンス管理基盤へ転換する。TechCrunchAIEnterpriseEdTech