🧠Research🔥🔥

Tencent Hunyuan、評価ベンチマーク IWC-Bench を発表──生成された Web アプリを実行して壊れたボタンを検出

ソースコードや静的画面の比較ではなく実際のブラウザ実行とコード網羅率を用いて、LLM による Web アプリ生成の挙動を検証する新ベンチマーク。
リリース: 2026-09-22 · 読了 3

記事の要約

1. 核心(What)

  • Tencent Hunyuan がコードの静的検査に代えて生成アプリをブラウザで実際に動かして評価する IWC-Bench を発表
  • Istanbul を用いたコード網羅率計測により、エージェントがアプリの十分な領域に到達したかを判定する仕組みを採用
  • 視覚的美観・実用性・要件適合性を 3 ラウンドの審査プロセスにより個別に 0 から 100 でスコアリング
  • データセットおよびソースコードはビジネス機密とデータ漏洩防止のため非公開、関連する ArtifactsBench のみ公開

2. 影響(Why)

  • 静的検証の限界を突破: ソースや単一画面の一致度だけではルーティング不備や機能しないボタンを検知できないため、実アプリを動作させる評価が必須になる。
  • 国内開発チームへの示唆: 国内の Web 系スタートアップが自社製コーディングエージェントの合否判定を厳格化する際、探索とスコアリングの分離設計が参考になる。

3. 根拠・詳細(How)

  • Istanbul による計測器の埋め込み: 生成された JavaScript に対して Istanbul ベースのツールでカウンタを追加し、プレーン HTML や Next.js などの環境で実行文を測定する。
  • カバレッジ誘導による探索: Playwright MCP を通じて AWorld ベースの LLM エージェントがブラウザを操作し、カバレッジの伸びが停止した際は未実行コードを解析して指示を供給する。
  • 多段階の審査プロトコル: アドボケイト・批評家・判定員の 3 ラウンド審査により視覚や使いやすさを評価し、スコアを五回実行のトリム平均で算出する。

4. 展望・課題(Next)

  • 非公開による再現の制約: 著者らはデータ漏洩防止のためデータセットとソースコードを非公開としており、他研究者による独立した再検証や追加モデルのテストは制限される。
  • 単一ターン・フロントエンドへの限定: 現在のベンチマークはシングルターンのフロントエンドタスクに限定されており、データベース連携やバックエンドを含むマルチターン開発への拡張は今後の課題。