ニューヨーク大学等、評価ベンチマーク GLUE を公開──自然言語理解システムの汎用性能を多角的に検証
MNLIやSST-2など9つのタスクを統合し、単一モデルの自然言語理解能力を包括的に測る標準ベンチマークとして機能する。
リリース: 2018-04-20 · 読了 2 分記事の要約
1. 核心(What)
- GLUE(General Language Understanding Evaluation)は自然言語理解システムの学習・評価・分析用リソース集である。
- MNLI、CoLA、MRPC、SST-2、Winograd NLIなど複数のタスクやコーパスで構成されている。
- 文のペア分類や意味的等価性、感情分析、テキスト含意などの多角的なタスクを包含している。
2. 影響(Why)
- 総合的な言語理解の測定: 単一のタスクに特化した過学習を防ぎ、多様な文脈や統御タスクを通じたモデルの汎用的な言語能力を評価できる。
3. 根拠・詳細(How)
- マルチタスク評価の構造: MNLIやSST-2などの個別データセットを結合し、テキスト含意や受容可能性などの異なる linguistic phenomena を統合パイプラインで検証する。