2026-09-03 · 8 topics
carloslfu、推論サーバー slotstream を公開──125B の Qwen3.8-Flash-Next を 48GB Mac で毎秒 12 トークン実行
🔥🔥105GB の MoE モデルを SSD からストリーミングし、ユニファイドメモリの制約下でも実用的な速度でローカル実行を可能にする Swift バイナリの推論エンジン。
AWS、推論サーバー Amazon Bedrock で OpenAI GPT-5.6 を提供開始──シドニーおよびメルボルンリージョンでグローバルクロスリージョン推論に対応
🔥🔥国内からオーストラリアリージョンを経由して OpenAI GPT-5.6 の Sol・Terra・Luna モデルにアクセス可能になり、データレジデンシーを維持しつつ 100 万トークンの長文脈処理を AWS 経由で実行できる。
Cursor、エージェント SDK 自社サーバー実行機能「Self-Hosted Machines」を公開──AWS Lambda や Modal などの外部サンドボックス連携に対応
🔥🔥Cursor のクラウドエージェントを自社インフラや提携サンドボックスで実行可能にし、社内サービスやプライベートリポジトリへの安全な接続を実現した。
Perplexity、推論サーバー Lily を公開──Apple Silicon で Qwen3.6 を MLX-LM 比 1.35 倍に高速化
🔥🔥Perplexity が Apple Silicon 専用にスクラッチ開発した推論エンジン Lily を公開し、カスタム Metal カーネルと Rust ランタイムにより Qwen3.6-35B-A3B のデコード速度を MLX-LM 比で 1.35 倍に引き上げた。
Anthropic、EC エージェント SDK Commerce Agents を公開──買物カゴ単価を 35% 向上
🔥🔥Anthropic がショッピング・マーチャント向けの Commerce Agents ブループリントを公開し、複数ドメインのセッション維持と安全なハーネス設計で購買完了率を 60% 改善した。
Anthropic、エージェント SDK Claude Code にバックグラウンド操作ツールを追加──macOS でカーソル占有を解消
🔥🔥macOS の別ディスプレイレイヤーで computer use を非表示実行し、開発作業を中断せずに GUI 操作を委譲可能に。
GitHub、VS Code 拡張 GitHub Copilot のコスト効率化手法を公開──ファイル読込の行番号プレフィックス削除などで推論コストを約 5% 削減
🔥🔥局所的なトークン削減ではなくタスク全体のエンドポイント効率を重視し、ファイル読込の冗長な行番号削除やプロンプト圧縮を検証した設計手法を共有する。
Nous Research、エージェント SDK Hermes Agent v0.21.0 Pantheon を公開──マルチゲートウェイ統合とエージェント間 DMs を実装
🔥🔥ローカルやクラウド上の複数エージェントを 1 つのデスクトップから常時接続で統合管理し、ボット間 DM や実行中サブエージェントの動的修正を可能にした。