Apple ML Research、エージェント評価用シナリオ生成アーキテクチャ Agent Seer を公開──MCP 仕様書から対話データを自動合成
MCP 仕様書のスキーマ情報を基に、手動キュレーションやライブツール実行なしで多段階のツール利用評価シナリオを自動合成する。
リリース: 2026-05-01 · 読了 3 分記事の要約
1. 核心(What)
- Apple ML Research が、ツール利用エージェントの評価用シナリオを自動合成するフレームワーク Agent Seer を発表した。
- モデルコンテキストプロトコル (MCP) の仕様書を入力として、手動キュレーションやライブツール実行なしでマルチターン対話データを構築する。
- 7 種類の多様なドメインとツールスイート規模の MCP 仕様書で評価され、小規模および中規模の仕様で完全なツール網羅性を達成した。
2. 影響(Why)
- エージェント検証コストの圧縮: 手動によるテストケース作成コストを削減できるため、MCP 対応サーバーを開発するインハウスチームは、API 変更に追従する評価ベンチマークを自動で維持できるようになる。
- 国内 SaaS 開発への実務影響: 社内業務エージェントを自社構築している国内の AI 開発企業(SIer や Vertical SaaS 規模)は、ツール連携テストの網羅性を担保するためのテストデータ生成基盤として Agent Seer の設計をそのまま応用できる。
3. 根拠・詳細(How)
- 潜在情報の抽出とスキーマ拡張: 関数名、自然言語の説明、型付きパラメータスキーマから潜在情報を抽出し、生データを拡張して合成ツール出力を生成する。
- 失敗モードの分析結果: 7 種類の MCP 仕様書を用いた検証により、パラメータスキーマの複雑さが品質変動の最大の要因であり、引数値の精度が不完全なシナリオにおける支配的な失敗モードであることを特定した。
4. 展望・課題(Next)
- 複雑なスキーマへの対応: パラメータスキーマが極端に複雑なケースにおけるデータ合成の精度向上が今後の課題となる。