🛠Tools🔥🔥

ローカルモデルランナー masahiroid、Core ML版 ruri-v3 と Apple NLContextualEmbedding を iPhone 17 Pro で比較──古典日本語の意味検索精度を検証

iPhone 17 Pro実機を用いて日本語文埋め込みモデル ruri-v3 と Apple 標準機能の類似度検索を比較し、古典文語における検索精度の優位性と実用上のトレードオフを実証した。
リリース: 2026-09-25 · 読了 3 分

記事の要約

1. 核心(What)

  • 著者らは日本語文埋め込みモデル ruri-v3(cl-nagoya/ruri-v3-130m)をCore MLへ変換し、iPhone 17 Pro実機上で動作速度と検索精度を検証した。
  • 検証ではiOS標準の Apple NLContextualEmbedding と比較し、現代文・古典文語・英語を含む19件の文書セットで類似度スコアを測定した。
  • ruri-v3はfp16版(265MB)とint8量子化版(133MB)の2種類でテストされ、int8版はサイズが半減しながら推論速度と精度を維持した。
  • テストの結果、ruri-v3は古典4文書を無関係文書より上位に置いたのに対し、Apple日本語モデルは古典文書を無関係文より低いスコアにする逆転現象を示した。

2. 影響(Why)

  • 日本語特化モデルによる精度担保: 汎用的なOS標準モデルではキャッチできない古典文や特殊な文語表現の意味的類似度を担保できるため、ローカル検索の品質を大きく引き上げる。
  • 実務的なモデル選択の指針提示: [国内 オンデバイスAI開発 規模] のチームがiOSでRAGやセマンティック検索を設計する際、初期実装コストとドメイン精度のどちらを優先すべきかの判断材料になる。

3. 根拠・詳細(How)

  • Core ML変換とプレフィックス仕様: ruri-v3固有の「1+3プレフィックススキーム」を適用し、Core MLのグラフ内で文埋め込みを取得。実行環境には iPhone 17 Pro (iOS 27) の MLComputeUnits.all を利用した。
  • int8量子化による軽量化検証: fp16版(265MB)とint8版(133MB)の間で全19文書のスコア差を比較し、最大誤差が0.0042に収まることを実機ログから確認した。

4. 展望・課題(Next)

  • ruri-v3-310mの実機検証: Mac上の参考検証にとどまっている310mモデルについて、iPhone実機での完全な検証と古典理解能力の再確認を行う予定。