🛠Tools🔥🔥

Magnitude、推論サーバー Magnitude を公開──llama.cpp 比で最大 2 倍の高速化を実現

デバイス固有のカーネル自動コンパイルにより、Apple Silicon および CUDA 環境でのデコード速度を大幅に向上させたエージェント向けオープンソース推論エンジン。
リリース: 2026-10-01 · 読了 2 分

記事の要約

1. 核心(What)

  • デバイス上のハードウェア構成に合わせてカーネルを自動コンパイル・チューニングする推論エンジン。
  • Apple Silicon、NVIDIA、AMD GPU、および CPU 環境に対応し、デスクトップアプリとして配布される。
  • Pi、OpenCode、Codex などの既存エージェントと 1 クリックで接続可能な OpenAI 互換 API を提供する。

2. 影響(Why)

  • ハードウェア固有の最適化: 一般的な推論エンジンが汎用カーネルを事前コンパイルするのに対し、実機でチューニングするためチップ性能を限界まで引き出せる。
  • 国内ローカル開発への効果: 外部 API を利用できない機密データを扱う国内の受託開発現場において、高速なオープンモデル運用環境を容易に構築できる。

3. 根拠・詳細(How)

  • カーネルのオンデバイスチューニング: モデル実行前にデバイスの実環境でカーネルをビルドし、popular open-weight families に特化した手動最適化カーネルを適用する。
  • プレフィックスキャッシュの共有: 並行セッション間でプレフィックスキャッシュを共有することで、エージェントの複数同時実行時の速度低下を防ぐ設計。

4. 展望・課題(Next)

  • 対応モデルの拡充: 主要なオープンウェイトモデルファミリーに対する最適化カーネルの順次追加が予定されている。