Aleph Alpha、オープン推論モデル Kolibri-1 を公開──78B MoE で 1M トークン長に対応
欧州の主権 AI を標榜する Aleph Alpha が総パラメータ 78.1B、アクティブ 3.46B の MoE アーキテクチャを持つオープンモデル Kolibri-1 を Apache 2.0 ライセンスで発表した。
リリース: 2026-10-04 · 読了 3 分記事の要約
1. 核心(What)
- 独 Aleph Alpha が総パラメータ 78.1B、アクティブパラメータ 3.46B のオープン推論モデル Kolibri-1 を発表
- ドイツ語と英語を中心に、Apache 2.0 ライセンスでモデルウェイトと構成を公開
- AIME 2025 で 96.9、GPQA Diamond EN で 84.3 のスコアを記録
- ドイツおよびフィンランドの NVIDIA B200 GPU 768 基を用い、20T トークンでゼロから学習を実施
2. 影響(Why)
- 単一 GPU で稼働する長文脈 MoE: FP8 量子化により全ウェイトが約 78 GB に収まるため、H200 や B200 の単一 GPU で 1M トークン長の推論を回せる点が、オンプレミス環境の運用コストを劇的に下げる。
- 欧州圏のデータ主権と厳格なコンプライアンス要件: 金融やヘルスケアなどの国内厳格規制業界(中規模以上のエンタープライズ)において、ドイツ製かつ Apache 2.0 のオープンモデルを自社 VPC 内で完結させる有力な選択肢となる。
3. 根拠・詳細(How)
- スパース構造とアテンション機構の分離: 全 78.1B のうち各トークンで発火するのは 3.46B のみ。アテンション層は 4-to-1 のパターンを採用し、大部分のレイヤーで直近 512 トークンを走査しつつ、周期的なグローバル層で全体をカバーする。
- 位置スケーリング不要のコンテキスト拡張: 初期トレーニング 16k から段階的に拡張され、ネイティブで 262k、検証テストで最大 1,048,576 トークンを達成。スライディングウィンドウ層のみに位置エンコーディングを適用するため YaRN や RoPE スケーリングを回避。
- FP8 と動的量子化による省メモリ化: ウェイトは 128x128 ブロックの FP8 で保持し、アクティベーションは動的に量子化。一方、埋め込み層・正規化層・LLM ヘッド・エキスパートルーターは bfloat16 を維持し精度劣化を抑制。
4. 展望・課題(Next)
- vLLM プラグインを通じた実運用テスト: 公式提供されている vLLM プラグインおよび Merlin-Arthur 強化学習プロトコルを用いた実環境でのハルシネーション制御検証が今後の課題となる。