🧠Research🔥🔥

研究チーム、ルーティング特化モデル JiRackUltra_1b を公開──CPU 単体で動作する 1.5B 3値ウェイト設計

専用のルーティング・ツール呼び出し用タグを組み込んだ 1.5B 規模の 3 値量子化モデルであり、GPU なしでローカル環境でのエージェント制御を可能にする。
リリース: 2026-09-27 · 読了 3 分

記事の要約

1. 核心(What)

  • JiRackUltra_1b は Hugging Face で 910K+ のダウンロードを記録した約 1.5B パラメータの 3 値量子化モデルである。
  • 再設計された Llama-3.2-1B ブロックをベースにし、BitNet 系のネイティブ 3 値学習を採用している。
  • GGUF 形式の量子化モデル(0.24 GB から 0.55 GB)が提供され、Ollama、llama.cpp、Docker(ポート 7869)で実行できる。
  • MIT ライセンスでウェイトが公開されている一方、パッケージ化された Docker および Ollama イメージは年間 12 ドルの利用料が設定されている。

2. 影響(Why)

  • GPU 非依存による検証コストの劇的な低下: CUDA ランタイムや専用の GPU ホストを用意する必要がなく、Ryzen 5 と 2-4 GB RAM のノート PC 上で動作するため、手元でのプロトタイピングのハードルが下がる。
  • 国内のエッジ AI 開発におけるハードウェア制約の緩和: GPU を搭載できない国内の車載・組込み開発現場において、オフラインで動作する軽量なルーター兼ツール呼び出しモデルとして組み込める選択肢が増える。

3. 根拠・詳細(How)

  • 再設計されたアーキテクチャとカスタムトークナイザー: 2048 hidden、16 layers、GQA 32/8 の構成に加え、専用の Routing、Tool call、Robotics タグを追加したカスタムトークナイザーによりエージェントパイプラインを処理する。
  • 軽量な 3 値量子化と実行環境の仕様: BitNet b1.58 方式のネイティブ 3 値ウェイトを採用し、Q2_K(0.24 GB)からフル精度(0.55 GB)までの 4 種類の GGUF 量子化により、CPU のみでの高速な推論を実現している。

4. 展望・課題(Next)

  • アプリケーション側の検証とセキュリティ対策: 生成された引数の検証、スキーマの強制、ツールの認可、実行失敗時のハンドリングはすべてアプリケーション側で実装する必要がある。