iKala、繁体字 LLM 評価ベンチマーク TMMLU+ v1.1 を公開──台湾の専門領域 66 科目を網羅し品質を検証
台湾の法的・教育的コンテキストを反映した 66 科目の評価データセットを更新し、ルールベーススキャンと専門家レビューにより 539 問を削除、197 問の回答を修正した。
リリース: 2024-01-01 · 読了 2 分記事の要約
1. 核心(What)
- iKala は繁体字 LLM 評価ベンチマーク TMMLU+ v1.1 をリリースした。
- データセットは STEM、社会科学、人文学、その他の 4 カテゴリにわたる 66 科目を網羅している。
- 4 つのルールベーススキャンにより 22,742 問中 6,116 問の候補が検証された。
- 専門家によるレビューを経て 197 問の回答・問題文が修正され、539 問が削除された。
2. 影響(Why)
- ローカライズ精度向上: 台湾固有の法規や社会制度に関する不正確な問題が排除されたため、繁体字圏向けモデルの実用的な推論能力を正確に測れる。
- 評価の信頼性担保: 曖昧な問題や古い法令に基づくデータが取り除かれており、モデル間のベンチマークスコアのノイズを低減できる。
3. 根拠・詳細(How)
- ルールベーススクリーニング: 4 種類のルールベーススキャンにより 22,742 問から 6,116 問の問題候補を抽出し、潜在的な問題を特定した。
- 専門家による人手レビュー: スキャン結果に基づき 691 問を対象に専門家レビューを実施し、197 問の回答修正および 539 問の完全削除を行った。
- HuggingFace 統合: datasets ライブラリの load_dataset 関数を使い、engineering_math や dentistry を含む 66 タスクごとに分割データをロード可能。
4. 展望・課題(Next)
- 追加ドメインの拡充: 今後のアップデートでは、急速に変化する専門領域や新しい法規制に対応したデータセットの拡張が予定されている。