OrcaRouter、セキュリティ特化モデル OrcaSAQ-2 Cyber 27B を公開──27B モデルを 15.7 GB に圧縮し単一 GPU で稼働
Qwen3.8-27B ベースのセキュリティー特化モデルを量子化により 71% 圧縮し、24GB の単一 GPU で 27.6 tok/s の推論速度を実現した。
リリース: 2026-09-29 · 読了 3 分記事の要約
1. 核心(What)
- OrcaRouter は、Qwen3.8-27B Uncensored をベースにしたセキュリティ特化モデル「OrcaSAQ-2 Cyber 27B」を公開した。
- モデルサイズは BF16 の 54.7 GB から 15.7 GB へ 71.3% 圧縮され、24GB の単一 GPU で動作する。
- WikiText-2 における WikiText-2 評価では、パープレキシティ変化が +0.80%、Top-1 一致率が 94.4%、平均 KLD が 0.020 と報告されている。
- ハイブリッド Gated DeltaNet とフルアテンションのアーキテクチャにより、262K の長文脈コンテキストを維持している。
2. 影響(Why)
- ローカル環境での機密コード解析: クラウド API へ送信できない専有ソースコードや脆弱性バイナリを、単一の 24GB GPU でオフライン解析できるため、セキュリティ監査のインフラコストが大幅に下がる。
- 国内セキュリティ企業のローカル運用: 国内の脆弱性診断やペネトレーションテストを担うセキュリティベンダー(中堅規模)は、商用 API の規約に縛られず VPC 内で完結する検証環境を構築可能になる。
3. 根拠・詳細(How)
- 量子化と高速化の仕様: Apache-2.0 ライセンスの GGUF 形式で提供され、llama.cpp、Ollama、vLLM、Docker Model Runner に対応。DFlash2 によるロスレス推論デコーディングで単一ストリーム 27.6 tok/s を達成している。
- 検閲解除による広範な適応: 学習済みの拒否行動(learned refusal)が削除されており、エクスプロイト隣接プロンプトを含む認可されたセキュリティ研究や脆弱性調査を直接実行できる。
4. 展望・課題(Next)
- デプロイ時の責任と制限: モデルの圧縮とローカル実行に伴う精度・アクセス制御・運用の安全性はすべてデプロイ側の責任となるため、実運用前の検証工数が必要。