研究チーム、AI エージェントの自己最適化手法 Self-Harness を発表──AppWorld でスコアが 132% 向上
プロンプトや制御フローなどのエージェント構成要素を自動書き換えする Self-Harness により、複数のモデル・ベンチマークで性能が大幅に向上した。
リリース: 2026-10-05 · 読了 3 分記事の要約
1. 核心(What)
- AI エージェント自身の構造を自己書き換えして最適化する Self-Harness フレームワークが複数のモデルファミリーで検証された。
- Terminal-Bench-2.0、SWE-bench Verified、AppWorld の各ベンチマークで最大 132% の相対的改善が確認された。
- Qwen3.5-35B-A3B の AppWorld におけるスコアは 22.5% から 52.2% に向上した。
- EnvHarness は 5 つのベンチマークでインタラクションステップ数を約 9.8% 削減しつつタスク精度を改善した。
2. 影響(Why)
- 手動チューニングのコスト削減: プロンプトやツール定義を手動で調整する限界を突破し、実行履歴に基づく自動最適化ループによってエージェントの保守コストを大幅に引き下げる。
- 国内開発のアーキテクチャ移行: [国内 AI アプリケーション開発ベンダー] のような開発現場では、固定的なプロンプト設計から、トレース駆動型でスキルが自己進化する仕組みへの移行が競争力の源泉になる。
3. 根拠・詳細(How)
- Self-Harness による性能検証: Terminal-Bench-2.0、SWE-bench Verified、AppWorld の 3 ベンチマークを用い、Qwen3.5-35B-A3B で 132% の相対改善を実測値として検証した。
- EnvHarness による効率化: 5 つのベンチマークテストにおいて、インタラクションステップ数を約 9.8% 削減しつつ、保持タスクのスコアを最大 9 ポイント向上させる最適化ループを実行した。
4. 展望・課題(Next)
- 固定コンポーネントと可変層の切り分け: エージェントスタックの中でどこを固定し、どの部分を学習・自動書き換え対象にするかの設計指針の標準化が進む見通し。