🧠Research🔥🔥🔥

Kimi、2.8Tパラメータのオープンモデル Kimi K3 を公開──1Mコンテキストと Stable LatentMoE でスケーリング効率を 2.5 倍に向上

世界初となる 3T クラスのオープンウェイト・マルチモーダルモデルとして登場し、100 万トークンの長文脈と最小限のアクティブ数による高い推論効率を両立した。
リリース: 2026-07-27 · 読了 4

記事の要約

1. 核心(What)

  • Kimi K3 は 2.8T パラメータを持つオープンウェイトかつネイティブなマルチモーダルエージェントモデルである。
  • Kimi Delta Attention (KDA) と Attention Residuals (AttnRes) アーキテクチャを採用し、100 万トークンのコンテキストウィンドウをサポートする。
  • Stable LatentMoE フレームワークにより 896 エキスパート中 16 エキスパートのみをアクティブ化し、Kimi K2 比で約 2.5 倍のスケーリング効率を実現している。
  • SFT 段階以降に量子化認識トレーニング(QAT)を適用し、MXFP4 の重みと MXFP8 の活性化に対応している。

2. 影響(Why)

  • ローカル完結型 RAG と長文脈エージェント設計の現実解: 100 万トークンを実用的な推論効率で処理できるオープンウェイトの 3T クラスモデルが公開されたことで、外部商用 API に依存せず社内ドキュメントを全件投入するエージェント構築の選択肢が強まる。
  • 国内テックリード・開発現場への影響: 高度なコーディングやターミナル操作を自律遂行する国内の受託開発・SaaS 企業は、GPU コストを抑えつつマルチモーダルな検証をローカル環境やプライベート VPC 内で内製化する検証を進める必要がある。

3. 根拠・詳細(How)

  • Stable LatentMoE によるスパース性最適化: 896 個のエキスパートから推論時は 16 個のみを発火させる仕組みをとり、計算量を削減しながら 2.8T パラメータ規模のフロントティア知性を担保している。
  • 量子化認識トレーニング(QAT)の統合: SFT 段階から MXFP4 の重みと MXFP8 の活性化を用いることで、広範なハードウェア環境での動作互換性とメモリ効率を維持している。

4. 展望・課題(Next)

  • API 提供とエコシステムの展開: 公式の platform.kimi.ai において kimi-k3 エンドポイントが公開されており、OpenAI および Anthropic 互換の API 形式で利用可能。