📜Papers🔥🔥

サイバーセキュリティにおける LLM 生成検知ルールの評価フレームワークとベンチマーク

LLM が生成したセキュリティルールの有効性を人間製コーパスと比較評価するオープンソースのフレームワークを提案し、専門家の評価手法にインスパイアされた 3 つの主要指標を導入した。
リリース: 2025-09-20 · 読了 5

論文概要

サイバーセキュリティ分野において LLM の活用が急増している一方、その有効性を測定する標準的な手法が不足しているという課題に対し、本論文では LLM が生成したセキュリティルールの有効性を評価するためのオープンソース評価フレームワークとベンチマーク指標を提案する。本手法では、人間が作成したルールコーパスを基準としたホールドアウトセットベースの methodology(方法論)を採用し、専門家の評価プロセスに着想を得た 3 つの主要な指標を通じて、多面的な有効性測定を実現している。

関連研究

セキュリティ分野における自動ルール生成や LLM の応用は進んでいるものの、生成されたルール自体の品質や実運用における有効性を厳密に比較・評価する共通のベンチマークはこれまで限定的であった。本研究は、人間が作成した既存の検知ルールコーパスと直接比較可能な評価基盤を提供することで、先行研究の評価における定性的なバイアスを解消する。

新規性と貢献

主な貢献は、セキュリティプラクティショナーの評価プロセスを模した 3 つの指標を持つオープンソースの評価フレームワークの構築である。Sublime Security の検出チームによるルールや、同社の Automated Detection Engineer(ADÉ)が作成したルールを用いた実証分析により、LLM 生成ルールの実用性とスキルセットを詳細に明らかにしている点に学術的・実用的な価値がある。

提案手法の詳細

提案するフレームワークは、人間が作成したルールコーパスと LLM 生成ルールをホールドアウトセットを用いて比較する設計になっている。セキュリティの専門家が実際の業務で行う評価プロセスを数理的・構造的に模倣することで、単なる構文の正確性にとどまらず、実運用における検知精度の多面的な検証を可能にしている。

Figure 1: ADÉ(Autonomous Detection Engineer)のワークフローを示す図版です。

評価・考察

評価では Sublime Security の検出チームおよび自動化ツールである ADÉ の出力結果を分析している。実験を通じて、LLM 生成ルールのスキルや実行コストに関する詳細な特性が示されており、人間製ルールとの差異や実用上のボトルネックが数値的に裏付けられている。

Figure 2: pass@kを関数としたLLM実行コストの関係を表すグラフです。

Figure 3: HTML検知ルールにおけるADÉ生成ルールと人間生成ルールの比較です。

応用例と今後の展望

本フレームワークは、セキュリティ運用センター(SOC)におけるルール自動生成パイプラインの品質管理や、LLM を用いた自動検出エンジニア(ADÉ)の開発支援に直接応用できる。日本のサイバーセキュリティ業界や金融・インフラ等のセキュリティ監視チームにおいて、AI 駆動型の脅威検知ルール導入時の信頼性検証コストを大幅に削減できる可能性があり、今後の実務適用が期待される。

結論

本論文は、LLM が生成するサイバーセキュリティルールの有効性を測定するためのオープンソース評価フレームワークを提示し、人間製コーパスとの比較を通じてその実用性と評価指標の妥当性を実証した。

注釈

  • ADÉ (Autonomous Detection Engineer): Sublime Security が開発した、自動で検知ルールを生成・エンジニアリングするためのシステム。