🧠Research🔥🔥

Aleph Alpha、オープン推論モデル Kolibri-1 を公開──78B MoE で 1M トークン長に対応

欧州の主権 AI を標榜する Aleph Alpha が総パラメータ 78.1B、アクティブ 3.46B の MoE アーキテクチャを持つオープンモデル Kolibri-1 を Apache 2.0 ライセンスで発表した。
リリース: 2026-10-04 · 読了 3 分

記事の要約

1. 核心(What)

  • 独 Aleph Alpha が総パラメータ 78.1B、アクティブパラメータ 3.46B のオープン推論モデル Kolibri-1 を発表
  • ドイツ語と英語を中心に、Apache 2.0 ライセンスでモデルウェイトと構成を公開
  • AIME 2025 で 96.9、GPQA Diamond EN で 84.3 のスコアを記録
  • ドイツおよびフィンランドの NVIDIA B200 GPU 768 基を用い、20T トークンでゼロから学習を実施

2. 影響(Why)

  • 単一 GPU で稼働する長文脈 MoE: FP8 量子化により全ウェイトが約 78 GB に収まるため、H200 や B200 の単一 GPU で 1M トークン長の推論を回せる点が、オンプレミス環境の運用コストを劇的に下げる。
  • 欧州圏のデータ主権と厳格なコンプライアンス要件: 金融やヘルスケアなどの国内厳格規制業界(中規模以上のエンタープライズ)において、ドイツ製かつ Apache 2.0 のオープンモデルを自社 VPC 内で完結させる有力な選択肢となる。

3. 根拠・詳細(How)

  • スパース構造とアテンション機構の分離: 全 78.1B のうち各トークンで発火するのは 3.46B のみ。アテンション層は 4-to-1 のパターンを採用し、大部分のレイヤーで直近 512 トークンを走査しつつ、周期的なグローバル層で全体をカバーする。
  • 位置スケーリング不要のコンテキスト拡張: 初期トレーニング 16k から段階的に拡張され、ネイティブで 262k、検証テストで最大 1,048,576 トークンを達成。スライディングウィンドウ層のみに位置エンコーディングを適用するため YaRN や RoPE スケーリングを回避。
  • FP8 と動的量子化による省メモリ化: ウェイトは 128x128 ブロックの FP8 で保持し、アクティベーションは動的に量子化。一方、埋め込み層・正規化層・LLM ヘッド・エキスパートルーターは bfloat16 を維持し精度劣化を抑制。

4. 展望・課題(Next)

  • vLLM プラグインを通じた実運用テスト: 公式提供されている vLLM プラグインおよび Merlin-Arthur 強化学習プロトコルを用いた実環境でのハルシネーション制御検証が今後の課題となる。