🧠Research🔥🔥

Naver、疎表現エンコーダーモデル splade-cocondenser-selfdistil が HuggingFace で 87.8 万ダウンロードを突破

BERT語彙に基づく30,522次元の重み付き疎ベクトルを出力し、MS MARCO devでBM25の約2倍となるMRR@10 37.6を記録したセマンティック検索モデル。
リリース: 2026-09-25 · 読了 3 分

記事の要約

1. 核心(What)

  • Naver Labsのsplade-cocondenser-selfdistilがHuggingFaceで87.8万ダウンロードを達成
  • 入力テキストからBERT語彙に基づく30,522次元の重み付き疎ベクトルを生成
  • MS MARCO developmentセットでMRR@10 37.6およびR@1000 98.4をマーク
  • CoCondenserベースにハードネガティブを用いたセルフディスティレーションで学習

2. 影響(Why)

  • 既存インフラとの高い親和性: ベクトルDBを新規導入せず、既存の転置インデックス上で内積計算によるセマンティック検索を行える点が、既存システムへの組込コストを劇的に下げる。
  • 国内検索基盤へのインパクト: [国内検索エンジン開発] 規模のチームは、BM25のスコアリング精度を約2倍に引き上げるための有力なベースラインモデルとして実戦投入を検討できる。

3. 根拠・詳細(How)

  • BERT語彙空間への写像とプーリング: マスク言語モデルヘッドが全入力位置の語彙をスコアリングし、非負値変換とマックスプーリングによって最強スコアを維持する重み付き疎ベクトルを構築する。
  • 転置インデックスへの統合方式: 出力された30,522次元のベクトルにおいてゼロ以外の次元をインパクト重み付きポスティングとして転置インデックスに保存し、ドット積でスコアを計算する。

4. 展望・課題(Next)

  • SPLADE-v3ファミリへの移行: 本チェックポイントは後継のSPLADE-v3ファミリの初期化チェックポイントとしても機能し、さらなる精度改善が期待される。
  • ライセンスの制約と運用上の課題: CC-BY-NC-SA-4.0の非商用ライセンスが適用されているため、商用プロダクトへの組み込みにはNaverとの個別合意が必要となる。