🧠Research🔥🔥

Ornith チーム、推論モデル Ornith-1.5-9B を公開──9B パラメータで 35B 級を超える性能を実現

Qwen3.5 および Gemma4 ベースの 9B 密結合モデルとして、NVIDIA の NVFP4 量子化と自己改善強化学習ループを採用し、単一 GPU での高度な推論とコーディングを可能にする。
リリース: 2026-09-25 · 読了 3 分

記事の要約

1. 核心(What)

  • Ornith-1.5-9B はパラメータ数 9B の NVFP4 量子化済み密結合推論モデルであり、Hugging Face でのダウンロード数が 85 万回を突破した。
  • SWE-bench Verified で 70.6、GPQA Diamond で 86.4 を記録し、35B 級の MoE モデルに匹敵する推論・コーディング性能を示す。
  • ネイティブコンテキスト長は 262K トークンであり、YaRN RoPE スケーリングファクター 4.0 により最大約 1M トークンまで拡張可能である。
  • vLLM、SGLang、Ollama、llama.cppに対応し、OpenAI 互換のツールコール機能を提供する。

2. 影響(Why)

  • ローカル環境における推論・コーディングのコスト対効果の向上: NVFP4 量子化と単一 Blackwell GPU 稼働により、商用 API に依存せず高精度なエージェント・コーディング環境を自社インフラへ直接組み込める。
  • 国内 SaaS 事業者のコスト構造の変革: [国内 AI エージェント開発・SaaS 事業者] のような中規模組織では、大規模商用 LLM の API 費用を大幅に削減し、月額コストを数分の一に圧縮したプライベート環境の推論基盤構築が現実的になる。

3. 根拠・詳細(How)

  • Qwen3.5 と Gemma4 をベースとした自己改善強化学習パイプライン: 事前学習・中間学習・後学習を経て、タスク生成、エージェントスカフォールドの調整、ロールアウト改善を強化学習ループで一体的に回す設計。
  • NVIDIA Blackwell ネイティブ FP4 テンソルコアを活用した NVFP4 量子化: 16 個の値を 1 つの FP8 スケールで共有し、さらに FP32 スケールでテンソル全体の大きさを保持する階層構造により、FP16 比でメモリ使用量を約 3.5 分の 1 に圧縮。

4. 展望・課題(Next)

  • モバイル向けバリエーションの展開: モバイルハードウェア向けに特化した Ornith-1.5-9B-Mobile バリアントの配備と、端端末での実運用検証が今後の課題となる。