Microsoft Research、エージェント学習フレームワーク Orchard を公開──3B パラメータで SWE-bench Verified 73.0% を達成
再利用可能な Kubernetes 環境と学習レシピにより、小型オープンモデルが商用フロントティアシステムに匹敵するエージェント性能を実現した。
リリース: 2026-08-03 · 読了 3 分記事の要約
1. 核心(What)
- Microsoft Research はオープンなエージェント学習・評価フレームワーク Orchard を発表し、Kubernetes ベースの環境サービス Orchard Env を公開した。
- 開発者は Codex や OpenClaw などの実際のデプロイ用ハーネス内で直接エージェントをエンドツーエンドで訓練できる。
- Orchard-SWE は約 30 億のアクティブパラメータを用い、SWE-bench Verified で 69.7%(バリューモデルによるリランキング時は 73.0%)を記録した。
- Orchard-GUI は 400 件の蒸留デモンストレーションと 2,200 件のタスクにより、WebVoyager で 74.1% の平均スコアを達成した。
2. 影響(Why)
- 小型モデルによるコスト効率の高いエージェント開発: 巨大な商用 API に依存せずとも、3B 規模のオープンモデルで実用的なコード修正やブラウザ操作エージェントを自社構築できるため、AI 機能の運用コストを大幅に抑制できる。
- 国内受託開発および SaaS 事業者への影響: 国内の受託開発企業やバーティカル SaaS 事業者は、クローズドな基盤に依存せず、VPC 内で完結する高度なタスク自動化エージェントを独自の学習データで再構築する選択肢が現実的になる。
3. 根拠・詳細(How)
- Orchard Env によるスケーラブルな環境分離: Kubernetes 基盤をベースに数千の独立したコンポーネントを並列管理し、データ収集から強化学習のロールアウト、評価までを単一の再利用可能なサービスとして実行する。
- 段階的な強化学習と密な報酬設計: MiniMax-M2.5 や Qwen3.5-397B から蒸留された 107,000 件のインタラクションデータを活用し、プロセス報酬モデルやクレジットアサインメント方式の強化学習を適用している。
4. 展望・課題(Next)
- オープンソースコミュニティへのデータおよびレシピ公開: Orchard-SWE、Orchard-GUI、Orchard-Claw の 3 つのドメイン特化型学習レシピと訓練データが順次公開され、研究者コミュニティによる検証が進められる。