AWS、エージェント評価ツール Strands Evals と Amazon Bedrock AgentCore を発表──スキル選択と指示追従を検証
オープン標準の SKILL.md を用いたエージェントのモジュール型スキルに対し、選択精度や指示の遵守度を個別評価する機能を追加し、隠れた実行失敗を検知可能にした。
リリース: 2026-09-22 · 読了 3 分記事の要約
1. 核心(What)
- AWSは、Strands Evals SDKおよびAmazon Bedrock AgentCore Evaluationsにおいて、エージェントのスキル評価機能を追加した。
- Skill Selection Accuracy、Skill Instruction Following、SkillInvokedの3つの評価軸により、スキルの選択ミスや手順のスキップを検出する。
- 評価対象として、Strands AgentSkillsプラグインやClaude Code、OpenAI Agents SDKなどのセッションやメッセージリスト、OpenTelemetryトレースを利用できる。
- Skill Instruction Followingでは、Fully FollowedからNot Followedまでの5段階(1.0から0.0)で評価を行う。
2. 影響(Why)
- 実行失敗の隠蔽を防ぐ評価軸: モジュール型スキルを用いたエージェントは、不適切なスキルを選択したり手順を一部スキップしたりしても流暢な回答を出力するため、従来の出力品質指標では失敗を検知できない。
- 国内エンタープライズの開発負荷軽減: 国内の業務システム開発において、コンプライアンス手順やドキュメント処理の抜け漏れを自動テスト可能になるため、プロンプト調整のトライ&エラーにかかるコストを圧縮できる。
3. 根拠・詳細(How)
- 3つのスキル評価の仕組み: Skill Selection Accuracyはタスクと選択されたスキルの適合性を判定し、Instruction Followingは5段階で指示遵守度を評価、SkillInvokedは名前付きスキルのロードを決定的に検証する。
- オープンなスキル標準と対応環境: SKILL.md形式のモジュール型手順に対応し、Python 3.10環境やStrands EvalsのTracedHandler、CloudWatchのTransaction Searchを経由したOpenTelemetryトレースから実行軌跡を読み込む。
4. 展望・課題(Next)
- CI/CDパイプラインへの組み込み: report.test_passesを用いたビルドゲートの設定や、クリティカルなスキルに対するSkillInvokedの必須化による回帰テストの自動化が推奨されている。