🧠Research🔥🔥

Goodfire、Llama や Gemma の内部表現にブーバ・キキ効果を発見──言語モデルの幾何学的空間に人間の認知バイアスが構造化

Goodfire の解釈性プラットフォーム Silico を用いた調査により、モデルが意味とは独立して音韻と形状の感覚的結びつきを内部の隠れ状態に保持していることが判明した。
リリース: 2026-07-27 · 読了 3

記事の要約

1. 核心(What)

  • Goodfire は解釈性プラットフォーム Silico を用い、Llama と Gemma の内部活性化を調査した。
  • 隠れ状態の幾何学的空間において、スパイキーな音韻と丸みを帯びた音韻が明確に分離される方向性が発見された。
  • 「kiki」や「crisp」の一群と「bouba」や「mellow」の一群が、実際の意味とは無関係にそれぞれ異なる端にクラスターを形成した。
  • ブーバ・キキ効果に関する知見は 1920 年代以降、多数の文化や言語で確認されてきた認知科学の現象である。

2. 影響(Why)

  • トレーニングデータの統計的構造: 明示的な指示なしに、モデルが訓練テキストの統計的パターンからクロスモーダルな規則性を自発的に獲得していることが示された。
  • 国内評価チームへの影響: 国内 LLM の安全性やアライメント検証を手掛ける研究組織は、モデル内部の幾何学的なバイアス評価をベンチマークに取り入れる判断材料になる。

3. 根拠・詳細(How)

  • Silico による隠れ状態のプローブ: Goodfire の Silico プラットフォームを用い、Llama および Gemma の活性化空間における特定の幾何学的方向性を抽出して音韻の分離を検証した。

4. 展望・課題(Next)

  • 他の認知バイアスへの拡張: ブーバ・キキ効果以外の心理言語学的現象や人間の認知バイアスが、LLM の内部表現において同様に幾何学エンコードされているかの検証が期待される。