Ornith チーム、推論モデル Ornith-1.5-9B を公開──9B パラメータで 35B 級を超える性能を実現
Qwen3.5 および Gemma4 ベースの 9B 密結合モデルとして、NVIDIA の NVFP4 量子化と自己改善強化学習ループを採用し、単一 GPU での高度な推論とコーディングを可能にする。
リリース: 2026-09-25 · 読了 3 分記事の要約
1. 核心(What)
- Ornith-1.5-9B はパラメータ数 9B の NVFP4 量子化済み密結合推論モデルであり、Hugging Face でのダウンロード数が 85 万回を突破した。
- SWE-bench Verified で 70.6、GPQA Diamond で 86.4 を記録し、35B 級の MoE モデルに匹敵する推論・コーディング性能を示す。
- ネイティブコンテキスト長は 262K トークンであり、YaRN RoPE スケーリングファクター 4.0 により最大約 1M トークンまで拡張可能である。
- vLLM、SGLang、Ollama、llama.cppに対応し、OpenAI 互換のツールコール機能を提供する。
2. 影響(Why)
- ローカル環境における推論・コーディングのコスト対効果の向上: NVFP4 量子化と単一 Blackwell GPU 稼働により、商用 API に依存せず高精度なエージェント・コーディング環境を自社インフラへ直接組み込める。
- 国内 SaaS 事業者のコスト構造の変革: [国内 AI エージェント開発・SaaS 事業者] のような中規模組織では、大規模商用 LLM の API 費用を大幅に削減し、月額コストを数分の一に圧縮したプライベート環境の推論基盤構築が現実的になる。
3. 根拠・詳細(How)
- Qwen3.5 と Gemma4 をベースとした自己改善強化学習パイプライン: 事前学習・中間学習・後学習を経て、タスク生成、エージェントスカフォールドの調整、ロールアウト改善を強化学習ループで一体的に回す設計。
- NVIDIA Blackwell ネイティブ FP4 テンソルコアを活用した NVFP4 量子化: 16 個の値を 1 つの FP8 スケールで共有し、さらに FP32 スケールでテンソル全体の大きさを保持する階層構造により、FP16 比でメモリ使用量を約 3.5 分の 1 に圧縮。
4. 展望・課題(Next)
- モバイル向けバリエーションの展開: モバイルハードウェア向けに特化した Ornith-1.5-9B-Mobile バリアントの配備と、端端末での実運用検証が今後の課題となる。