🧠Research🔥🔥

Entelligence、コードレビュー特化低価格モデル GPT-5.6 Luna を評価──コストを 1/28 に抑える性能と精度検証

GPT-5.6 Luna と GPT-6 Astra のプルリクエスト検証により、安価なモデルは日常的なバグ検出で実用的な一方、認証や権限ロジックでは精度の見劣りが明らかになった。
リリース: 2026-09-09 · 読了 4

記事の要約

1. 核心(What)

  • GPT-5.6 Luna は入力 100 万トークンあたり $0.20、出力 100 万トークンあたり $1.20 で動作する。
  • Cal.com や Grafana など 50 件のパブリックベンチマーク PR に対し、Luna は 69 件、GPT-6 Astra は 92 件の検証済みバグを検出した。
  • 1 回のレビューあたりのコストは Luna が $0.0041、Astra が $0.113 となり、約 28 倍の価格差を記録した。
  • Luna の指摘の約 4 件に 1 件が検証を通過せず、セキュリティバグの検出数でも Astra の 19 件に対し Luna は 9 件にとどまった。

2. 影響(Why)

  • コスト削減と精度低下のトレードオフ: 数千件規模のプルリクエストを全件高価格モデルで処理するとコストが破綻するため、日常的なロジック検証を安価な Luna に任せる二段構えの設計が現実解になる。
  • 国内開発チームへの影響: コードレビュー自動化を導入している国内のテック企業(特に Vertical SaaS や EC 系スタートアップ)は、認証・認可関連の PR を除外して低価格モデルを適用する運用設計が必要になる。

3. 根拠・詳細(How)

  • ベンチマーク構成と検証手法: AI-Code-Review-Evals 組織の 50 件のパブリック PR を使用し、GPT-6 Astra と GPT-5.6 Sol の両方が重複排除とバグの判定を行った匿名化リストで検証した。
  • モデル別の処理速度と出力トークン数: Luna は 1 レビューあたり 23 秒で処理し、Astra の 36 秒よりも高速かつ、出力トークン数も 3.1 倍多く出力しながら低価格を維持した。

4. 展望・課題(Next)

  • コンテキスト不足の克服: 今回の検証では差分のみを渡しており、リポジトリ履歴やコールグラフを含めない制約が精度の限界にどう影響するか検証が続く。