Together AI、判定・ルーティング特化モデル Tev1-4B-experimental を公開──約 17 ドルで学習可能
Qwen3.5-4B をベースにした 40 億パラメータの判定モデルで、LoRA SFT による約 25 分の訓練と $0.042/100万トークンの安価なサーバーレス推論を実現。
リリース: 2026-09-25 · 読了 3 分記事の要約
1. 核心(What)
- Together AI が Jev パターンを採用した判定タスク特化モデル Tev1-4B-experimental をリリース
- 入力として状態、質問、2〜24 個のラベル付きオプションを受け取り、1 文字の解答を返すコントラクトを採用
- Qwen の標準的な自己回帰言語モデルヘッドをそのまま利用し、特殊な分類ヘッドを使用しない設計
- データレシピ、ソースコード、およびチュートリアルが完全にオープン化され再現可能
2. 影響(Why)
- 推論コストの劇的な圧縮: 出力トークンを 8 トークン未満に制限しつつ出力トークン無料のサーバーレス環境を利用できるため、大規模アクセスが集中するルーターの運用費を最小化できる。
- 専用インフラ不要の学習効率: 25 分・17 ドルという極めて低いハードルでドメイン特化型の判定モデルを自作できるため、汎用プロンプトエンジニアリングの限界を突破できる。
3. 根拠・詳細(How)
- Jev パターンに基づくプロンプトとスキーマ設計: state, question, options の 3 フィールドからなる JSON 契約を定義し、temperature=0 および出力制限 8 トークンで決定的な単一文字出力を強制する。
- 標準デコーダランタイムによるサービング: 特殊な分類ヘッドを廃し Qwen の標準デコーダヘッドを維持することで、専用の推論サーバーを用意せず通常のデコーダランタイム上で効率的に動作させる。
4. 展望・課題(Next)
- マルチモーダル入力への拡張計画: テキストベースの判定タスクから画像や構造化データを含んだ複雑な状態評価への拡張が期待されている。