🛠Tools🔥🔥🔥

Niko1221、ローカルモデルランナー Strata を公開──125B パラメータの Qwen 3.8 Flash Next を一般 PC で稼働

12GB 以上の VRAM と 32GB 以上の RAM を備えた一般のゲーミング PC で 1,250 億パラメータの大規模モデルを動かし、商用 API に依存しないローカル RAG やコーディング環境を実現する。
リリース: 2026-10-04 · 読了 3 分

記事の要約

1. 核心(What)

  • 1,250 億パラメータの Qwen3.8-Flash-Next をローカルの一般 PC で動作させるオープンソースツール Strata が公開された。
  • NVIDIA RTX 5070 や AMD RX 9070 XT などの 12GB 以上の VRAM を搭載したグラフィックカードに対応する。
  • OpenAI 互換および Anthropic 互換の API を備え、Claude Code や Codex CLI などの既存ツールと連携可能。
  • 量子化サイズや RAM 容量に応じて Coder 版や各圧縮モデル(Q2_0、IQ2_XS、IQ3_S など)を選択してインストールできる。

2. 影響(Why)

  • ローカルハードウェアでの超大型モデル運用: サーバー運用のコストとデータプライバシーの懸念を同時に解消し、125B 級モデルをデスクトップ環境で実用的な速度で動かせる点が最大の違いである。
  • 国内開発現場への実用的なインパクト: 国内の受託開発やプライベートクラウド環境を重視する現場では、機密データを外部に出さずに最新のコーディング支援エージェントをローカルで試行できる。

3. 根拠・詳細(How)

  • ハードウェア要件と対応環境の仕様: 12GB 以上の VRAM(NVIDIA RTX 20/30/40/50 シリーズまたは AMD Radeon RX 7000/9000 シリーズ)と 32GB 以上のシステム RAM を必須とし、自動インストーラーが適切な量子化モデルを選択する。
  • API 統合とプロトコル仕様: http://127.0.0.1:8080/v1 の OpenAI 互換エンドポイントおよび /v1/messages の Anthropic 互換エンドポイントを提供し、MCP サーバー経由で AI ツールからの制御をサポートする。

4. 展望・課題(Next)

  • 対応ハードウェアの拡充: コミュニティベースで Intel Arc や旧世代 GPU(Tesla P40/V100 等)への対応およびマルチ GPU 構成の最適化が進められている。