MiniMax、動画生成モデル H3 を公開──Artificial Analysis 編集部門で首位を獲得
ネイティブ 2K 解像度とステレオ音声の同時生成に加え、最大 9 枚の参照画像や指示ベースの編集機能を備え、商用価格も競合比で約 1/3 に抑えた。
リリース: 2026-07-31 · 読了 3 分記事の要約
1. 核心(What)
- MiniMax は新型フラッグシップ動画モデル H3(Hailuo 3.0)を発表し、Artificial Analysis の編集ベンチマークで首位を獲得した。
- モデルはテキスト、画像、動画クリップ、音声を単一のパスで処理し、解像度 2560x1440 の動画と同期音声を同時出力する。
- オムニリファレンス機能により、最大 9 枚の画像や複数の動画・音声クリップを用いてキャラクターやスタイルのブレを抑制できる。
- 2K 音声付き生成コストは $0.13/秒に設定され、競合モデルと比較して割安な価格設定となっている。
2. 影響(Why)
- 制作コストの劇的な低下: 主要な競合モデルの半額以下の単価で 2K 音声付き動画を生成できるため、生成 AI を活用した動画マーケティングの ROI が直接改善する。
- マルチショットの一貫性確保: 最大 9 枚の参照画像を使えるため、AI 動画の最大の課題であるキャラクター崩れを防ぎ、実務レベルの編集作業に耐えうる。
- 国内 SaaS への実装インセンティブ: 国内の動画制作関連のスタートアップや中堅ベンダーは、API コストを抑えた状態で高度な編集機能を自社プロダクトに組み込める。
3. 根拠・詳細(How)
- マルチモーダル同時処理アーキテクチャ: テキスト、画像、音声の各種入力を単一のネットワーク構造で同時に処理し、ワンパスで映像とステレオ音声を同期生成する仕組みを採用している。
- オムニリファレンス制御: 最大 9 枚の参照画像と 3 件の動画・音声クリップを同時入力し、キーフレーム強制なしでスタイルやキャラクターの整合性を維持する。
4. 展望・課題(Next)
- オープンウェイト版の公開予定: 年間売上 2,000 万ドル未満の組織を対象としたコミュニティライセンスでのモデルウェイト公開が計画されており、LTS-2.3 を上回るオープンモデルとしての展開が期待される。