Magnitude、推論サーバー Magnitude を公開──llama.cpp 比で最大 2 倍の高速化を実現
デバイス固有のカーネル自動コンパイルにより、Apple Silicon および CUDA 環境でのデコード速度を大幅に向上させたエージェント向けオープンソース推論エンジン。
リリース: 2026-10-01 · 読了 2 分記事の要約
1. 核心(What)
- デバイス上のハードウェア構成に合わせてカーネルを自動コンパイル・チューニングする推論エンジン。
- Apple Silicon、NVIDIA、AMD GPU、および CPU 環境に対応し、デスクトップアプリとして配布される。
- Pi、OpenCode、Codex などの既存エージェントと 1 クリックで接続可能な OpenAI 互換 API を提供する。
2. 影響(Why)
- ハードウェア固有の最適化: 一般的な推論エンジンが汎用カーネルを事前コンパイルするのに対し、実機でチューニングするためチップ性能を限界まで引き出せる。
- 国内ローカル開発への効果: 外部 API を利用できない機密データを扱う国内の受託開発現場において、高速なオープンモデル運用環境を容易に構築できる。
3. 根拠・詳細(How)
- カーネルのオンデバイスチューニング: モデル実行前にデバイスの実環境でカーネルをビルドし、popular open-weight families に特化した手動最適化カーネルを適用する。
- プレフィックスキャッシュの共有: 並行セッション間でプレフィックスキャッシュを共有することで、エージェントの複数同時実行時の速度低下を防ぐ設計。
4. 展望・課題(Next)
- 対応モデルの拡充: 主要なオープンウェイトモデルファミリーに対する最適化カーネルの順次追加が予定されている。