🧠Research🔥🔥🔥

Aleph Alpha、オープンモデル Kolibri を公開──78B MoE と 1M トークン長文脈で欧州の主権的 AI を担保

独語と英語のバイリンガル設計と 3B のアクティブパラメータにより、コスト効率と最高水準の長文脈推論を両立した。
リリース: 2026-10-03 · 読了 4 分

記事の要約

1. 核心(What)

  • Aleph Alpha は 2026 年 10 月 3 日、ドイツ統一の日に合わせた新モデル「Kolibri」を Hugging Face で公開した。
  • Kolibri は総パラメータ数 78B、アクティブパラメータ数 3B の Mixture-of-Experts (MoE) 構造を採用し、最大 1M トークンの長文脈コンテキストをサポートする。
  • 事前学習トークンの 21.3% にドイツ語を使用し、翻訳テキストではなくネイティブのバイリンガル設計(英語 62%、コード 14% 等)を構築した。
  • ライセンスは Apache 2.0 が適用され、EU AI Act や GDPR などの欧州規制に準拠したサプライチェーンの透明性を担保している。

2. 影響(Why)

  • オンプレミス運用とコスト効率の両立: 総 78B のうち 3B のみがアクティブ発火する構造により、2基の H100 GPU で 18 の同時リクエストを処理可能。商用 API に依存しないプライベート環境での大容量 RAG 運用が現実解になる。
  • ハルシネーション抑制プロトコルの実装: Merlin-Arthur プロトコルとアブステーション(留保)データ学習により、文脈に答えがない場合に「わからない」と応答する仕様は、金融・行政向けの高信頼システム構築において監査コストを劇的に下げる。
  • 国内規制対応 SaaS への示唆: [国内 医療・行政システム受託開発] のような厳格なデータ主権を求められる事業者は、オープンウェイトかつ欧州法規準拠の本モデルを、ローカル VPC 内での高精度エージェント基盤の有力な代替選択肢として検証する価値がある。

3. 根拠・詳細(How)

  • ハイブリッドアテンション機構によるメモリ抑制: 50 層のうちフルコンテキストを処理するのは 10 層のみとし、残りの 40 層は 512 トークンの固定ウィンドウで処理することで、長文脈時のデコード計算量とメモリ消費量を恒常的に抑制する。
  • 3段階のマルチステージ事前学習: B200 GPU 768 基を使用し、16k シーケンス長で 20T トークンの事前学習、64k で 3.44T トークンのミッドトレーニング、256k で 200B トークンの長文脈適応を順次実行した。
  • 自動化されたモデルファクトリーパイプライン: GitHub Actions をベースに約 10,000 GPU 時間ごとに発生する 38 件のハードウェア障害を自動検出し、最大 250 ステップ前のチェックポイントから自律復旧する訓練基盤で高速イテレーションを実現した。

4. 展望・課題(Next)

  • 大規模スケールへの拡張課題: Kolibri Origin から Kolibri への短期間での進化を実証した一方、さらなるパラメータ拡大やスケーリング時におけるアーキテクチャの検証が今後の課題となる。