Utopai Studios、動画生成モデル Utopai X を公開──ベースの MiniMax H3 を上回り Artificial Analysis で 2 位を獲得
MiniMax H3 をベースにシネマティックなカメラワークと同期音声に特化させたチューニングを実施し、商用動画ベンチマークで上位に躍り出た。
リリース: 2026-09-30 · 読了 3 分記事の要約
1. 核心(What)
- Utopai Studios は MiniMax H3 をベースモデルとした動画生成モデル Utopai X を発表した。
- Artificial Analysis の AA-Video-T2V v2.0 リーダーボードにおいて、音声同期と物理挙動の項目で首位を獲得した。
- モデルの利用は同社が提供するブラウザベースの制作プラットフォーム PAI 内に限定されている。
- エントリプランの価格設定に基づくと、生成コストは 1 分あたり約 83.70 ドルの換算となる。
2. 影響(Why)
- 特化型後学習の有効性: 一般的な基盤モデルに対してドメイン特化の調整を加えることで、フィルム制作や広告用途で求められるカメラワークや物理挙動の品質を大幅に引き上げられる点を示している。
- ワークフロー統合の評価: [国内の映像制作・広告代理店業種] のような実務チームは、単体クリップの性能だけでなく、一連のシーンを通した連続性管理がプロジェクト全体の工数を左右する。
3. 根拠・詳細(How)
- ベンチマーク評価の構造: Artificial Analysis の AA-Video-T2V v2.0 を用いて音声同期・物理挙動・照明・カメラコントロールの 10 項目で評価され、音声同期と物理挙動で首位、照明とカメラコントロールで 2 位を記録した。
- プラットフォーム仕様とアクセス: 専用ブラウザツール PAI 内の統合制作ワークフローとして提供され、個別クリップ生成だけでなくキャラクターや環境のコンティニュイティを管理する設計となっているが、内部の最適化手法やデータセットの詳細は未公開。
4. 展望・課題(Next)
- API 提供と仕様公開の動向: パブリック API の公開予定や、後学習に用いたデータセット・計算資源の詳細に関する情報は明らかにされていない。