LLM アプリフレームワーク Jev ライクなマルチモーダルラッパー公開──ログ確率でウェブカムを構造化評価
テキストや画像に対する複数質問を logprobs で 1 トークン出力に強制し、RTX 3090 上の Gemma 4 12B で約 1 FPS の構造化スコアリングを実現した。
リリース: 2026-09-25 · 読了 3 分記事の要約
1. 核心(What)
- Jev ライクな LLM ラッパーに画像添付機能 (attachments) を拡張し、ビジョンモデルの出力評価に対応した
- max_completion_tokens を 1 に制限し、top_logprobs を取得することで選択肢の確率を強制的に計算する
- Gemma 4 12B (RTX 3090) で 1 FPS、gpt-6-luna API で 0.2 FPS の処理速度を確認した
- OpenCV と uv ランタイムで動くスタンドアロンの Python スクリプトとして公開された
2. 影響(Why)
- ログ確率による高速な構造化: 自由記述の長文生成を避け、1 トークンの logprobs を直接正規化することで、分類やスコアリングの処理遅延を最小限に抑えられる。
- プロンプト駆動のビジョン判定: 専用の画像認識モデルを学習・デプロイする手間を省き、テキストによる条件記述だけでカメラ映像の判定ロジックを即座に変更できる。
3. 根拠・詳細(How)
- ログ確率とトークン制限の制御: max_completion_tokens を 1 に設定し、top_logprobs を有効化して返却された代替トークンの確率分布から数学的に選択肢の確率を算出する。
- マルチモーダル入力の拡張設計: 標準の Jev 形式に attachments フィールドを独自追加し、ローカルの画像ファイルパスや base64 エンコードされた JPEG を各質問のコンテキストに統合する。
4. 展望・課題(Next)
- API コールごとのオーバーヘッド削減: 質問ごとに分離しているリクエスト処理を最適化し、同一フレームに対する複数質問のネットワーク往復コストを削減する余地がある。