abenzerps、画像生成モデル Qwen-Image-2.1-Uncensored-GGUF を公開──コンテキストフィルター解除と GGUF 量子化でローカル動作を最適化
Qwen-Image-2.1 のベースモデルからコンテンツフィルターを解除した GGUF 版が公開され、ComfyUI と ComfyUI-GGUF フォークを組み合わせて単一 GPU でローカル実行が可能になった。
リリース: 2026-09-20 · 読了 3 分記事の要約
1. 核心(What)
- abenzerps は Qwen-Image-2.1 の元重みからフィルターを排除した GGUF 版の配信を開始し、月間ダウンロード数は 876,673 を記録した。
- ComfyUI-GGUF の leejet フォークを活用することで、GGUF 化されたトランスフォーマー、テキストエンコーダー、VAE の各コンポーネントを直接配置できる。
- 推論時は拡散モデルを GPU VRAM に保持し、テキストエンコーダーを System RAM に逃がすことで、VRAM 消費を 9-17GB 削減する構成を提示している。
- モデルのリビジョンは b3179ad355be050328e483a9dfdd9e60cd62adfa、変換には stable-diffusion.cpp のコミット 1330cebae8f2ba99249df846cc0c9444fcbd4308 を使用している。
2. 影響(Why)
- ローカル環境での VRAM 圧迫を軽減: テキストエンコーダーをシステム RAM にオフロードする構成により、ミドルレンジのローカル GPU 環境でも VRAM 容量の制約をクリアして画像生成パイプラインを回せる。
- 国内のクリエイティブ・検証現場への影響: 個人開発やインディーゲーム制作を行う [国内 個人開発・インディー制作スタジオ] 規模のチームにとって、クラウド API コストをかけずに独自の検閲なしパイプラインをローカル検証できる選択肢が増える。
3. 根拠・詳細(How)
- モデル構成と GGUF 量子化仕様: diffusion_models ディレクトリに qwen-image-2.1-UC-Q4_K_M.gguf を配置し、Unet Loader (GGUF) ノード経由で読み込ませることで量子化モデルを動作させる。
- コンポーネント別の配置先とメモリ分割: テキストエンコーダー qwen3vl_8b_int8_convrot.safetensors をシステム RAM 側に割り当て、VAE を qwen_image_2.1_vae_bf16.safetensors に設定して ComfyUI-GGUF の leejet フォークで実行する。
4. 展望・課題(Next)
- ComfyUI-GGUF のバージョン追従: 旧来のシティ96系フォークでは Unknown model architecture エラーが発生するため、 leejet フォークへの移行や tools/convert.py への ModelQwenImage 追加が必要となる。