Alibaba、画像生成モデル Qwen-Image-2.1 を公開──7B パラメータで透過 PNG 生成と高精度編集に対応
7B パラメータの DiT アーキテクチャを採用し、単一モデルでテキストからの画像生成と最大 10 枚の参照画像を用いた高度な編集を両立する。
リリース: 2026-09-14 · 読了 3 分記事の要約
1. 核心(What)
- Alibaba はオープンソースの画像生成・編集モデル Qwen-Image-2.1 を公開した。
- ビジュアル生成部で 7B パラメータ、32 層の Single-Stream DiT アーキテクチャを採用している。
- 通常画像の生成に加え、アルファチャンネルを含む透過(RGBA)画像の出力や複数参照画像による編集を 1 つのモデルで実現する。
- Hugging Face の diffusers ライブラリおよび torch>=2.4.0 環境に対応し、パイプラインコードが提供されている。
2. 影響(Why)
- ローカル環境への実装ハードル低下: 7B パラメータ規模に抑えられているため、商用大手中規模の画像生成 SaaS 事業者は単一 GPU 環境でパイプラインを構築しやすくなる。
- ワークフロー統合の効率化: 背景切り抜きや局所編集を別モデルに分ける必要がなくなるため、国内のデザインツール開発企業や受託制作現場における処理工程を短縮できる。
3. 根拠・詳細(How)
- 軽量化とアテンション機構の設計: 混合粒度アテンションとプレフィックス KV キャッシュの再利用を組み合わせることで、低計算コストで画質を維持する構造を採用。
- diffusers ライブラリによる実装仕様: transformers>=5.17 および accelerate、pillow を前提とし、QwenImage21Pipeline クラスを用いて bfloat16 精度でロードする。
4. 展望・課題(Next)
- ライセンス適用の確認: Qwen Research License Agreement に準拠しており、商用利用時の制約や配布条件を確認した上での導入が必要となる。