autotrust、ビジョン対応モデル JEV-27B-VL を公開──Plan-RewardBench で 73.2% を記録し SOTA を更新
単一フォワードパスでの確率出力を特徴とし、Plan-RewardBench で 73.2% を記録して既存商用モデルを上回った。
リリース: 2025-12-18 · 読了 3 分記事の要約
1. 核心(What)
- autotrust がビジョン対応モデル JEV-27B-VL を HuggingFace に公開した。
- Plan-RewardBench (ACL 2026) で 73.2% の macro-average 精度を記録した。
- VL-RewardBench で 78.3% の全体精度を達成した。
- vLLM サーバに統合可能な serve_decide.py が提供されている。
2. 影響(Why)
- 単一パスによる高速な確率出力: 複数ステップの推論や外部モデルへの依存を排除し、1回のフォワードパスで選択肢ごとの確率を直接算出できる。
- 国内 SaaS のコールドスタート課題解決: EC や動画プラットフォームにおける新着アイテムの推薦を画像カバーのみで即座に処理できるため、初期ログ蓄積の必要がない。
3. 根拠・詳細(How)
- vLLM 統合と serve_decide.py: vLLM の標準サーバーに POST /v1/decide ルートを追加し、80GB 以上の GPU 単体で動作する環境を提供する。
- ベンチマーク検証環境: Plan-RewardBench や VL-RewardBench の公開データセットを使用し、マルチモーダル環境下でのゼロショット精度を検証している。
4. 展望・課題(Next)
- 画像編集タスクの精度向上: 現行バージョンで最も弱いとされる画像編集領域における評価精度の改善が今後の課題となる。