推論アクセラレータ openTPU を公開──FPGA カードで 10 モデルのローカル実行を実現
AI 自らがハードウェア設計を手がけたオープンソースの推論アクセラレータ。単一の FPGA カード上で 10 種類のモダン LLM をビット単位で一致させて動作させる。
リリース: 2026-10-02 · 読了 3 分記事の要約
1. 核心(What)
- AI エージェント自身がハードウェア設計を手がけたオープンソースの AI アクセラレータ openTPU が公開された。
- ハードウェア設計(SystemVerilog)、命令セット、ビット正確なシミュレータ、カーネル言語とコンパイラ、ホストソフトウェアが単一のリポジトリに統合されている。
- Inspur YPCB-00338 FPGA カード上で LFM2.5-230M や Qwen3-0.6B をはじめとする 10 モデルの実行を実現している。
2. 影響(Why)
- ハードウェアからソフトまで一気通貫の学習環境: Python での行列積から FPGA の物理配線に至るまで単一のリポジトリで俯瞰できるため、アクセラレータの内部構造を深く理解したいエンジニアに最適である。
- 低リソース環境でのローカル推論検証: 単一の FPGA カードとホスト CPU の構成で商用モデルの推論を再現できるため、クラウドに依存しないエッジ推論の検証コストを劇的に引き下げる。
3. 根拠・詳細(How)
- システム構成とバージョン仕様: Xilinx Kintex-7 xc7k480t FPGA カード(DDR3-1066、ピーク帯域 17.1 GB/s)を搭載し、LiteDRAM コントローラーと 4 列シストリック行列演算ユニットを採用している。
- 量子化と性能の検証手法: FP4 値と 2 階層ブロックースケールを組み合わせた 4-bit 量子化(重みあたり平均 4.25 ビット)を採用し、LM ヘッドを int8 で保持することで精度を維持しながらデコード速度を 40% 以上向上させている。
4. 展望・課題(Next)
- 大規模モデルのストリーミング拡張: カードの 4 GiB 容量を超える Mixture-of-Experts モデルに対し、ホストストレージからのエキスパートストリーミング機能を用いた大規模モデルの動作検証が進められている。