結論:Qwen-Image-2.1はComfyUI v0.37.0以降でネイティブ対応。「Text Encode Qwen Image 2.1」ノードが出すlatentをそのまま使い、VRAMが足りなければ「Qwen Image 2.1 Cache」ノードでint8/int4に落とすのがコツです。ただし非商用ライセンスなので、検証・研究用途に限定しましょう。
背景透過(RGBA)の画像をプロンプトから直接出せる初の本格オープンウェイトモデルとして注目のQwen-Image-2.1。この記事では、ComfyUIでの導入手順と、つまずきやすい設定ポイントを5つのステップで解説します。
Qwen-Image-2.1の基本スペック
| 項目 | 内容 |
|---|---|
| 公開日 | 2026年9月20日 |
| 画像生成部 | 7B(前世代20Bから小型化) |
| テキストエンコーダ | Qwen3-VL系(約8B) |
| 解像度 | 既定 2048×2048、最大 2752×1536 |
| 出力 | RGBA(アルファチャンネル付き) |
| 参照画像 | 複数枚の参照で編集可(公式発表は最大10枚) |
| ライセンス | Qwen Research License(非商用のみ) |
| 対応環境 | ComfyUI(ネイティブ)、Diffusers ほか |
ステップ1:ComfyUIをv0.37.0以降に更新する
Qwen-Image-2.1のネイティブノードは v0.37.0(2026年9月21日) で追加されました。
- ポータブル版:
update/update_comfyui.batを実行 - git版:
git pull後にpip install -r requirements.txt - Comfy Desktop:アプリ内の更新から最新化
更新後、ノード検索で「Qwen Image 2.1」と入力し、ノードが出てくれば準備完了です。
ステップ2:モデルをダウンロードして配置する
Hugging Faceの公式リポジトリから、次の3種類をダウンロードします。
- 拡散モデル本体 →
ComfyUI/models/diffusion_models/ - テキストエンコーダ →
ComfyUI/models/text_encoders/ - VAE →
ComfyUI/models/vae/
VRAMが少ない環境では、int8 / w4a8 の量子化版を選びます。ファイル名や配置先は公式テンプレートのノートに記載されているので、テンプレートを開いて確認するのが確実です。
ステップ3:ワークフローを組む(テンプレート推奨)
最短はテンプレートから開く方法です。手動で組む場合の要点は次のとおりです。
- テキスト入力は Text Encode Qwen Image 2.1 ノード(
model/conditioning/qwen imageカテゴリ) - このノードが出力するlatentを使う:自前でEmpty Latent Imageを置くと、編集時に位置がずれる原因になります
- 参照画像の解像度設定は既定1024、32px刻みで最大4096、0を指定すると元サイズのまま
- 保存時は PNG形式で保存し、アルファチャンネルが残っているかを画像ビューアで確認
ステップ4:VRAMに合わせてCacheノードを設定する
実験的機能の Qwen Image 2.1 Cache ノードで、メモリの使い方を調整できます。
| 設定 | 選択肢 | 使いどころ |
|---|---|---|
| KVキャッシュの置き場所 | auto / gpu / cpu / off | 迷ったらauto、VRAM不足ならcpu |
| 保存精度 | int8 / int4 | int8で品質優先、int4でさらに省メモリ |
目安として、フル精度での自前運用は24GB以上が推奨されています。16GBクラスでは量子化版+Cacheのcpu/int8から試すのが現実的です(環境により結果は異なります)。
ステップ5:透過素材・編集で活用する
- 透過素材:アイコン、立ち絵の素材、ステッカー、ゲームUIの試作など「切り抜き作業」を省けます
- 複数参照編集:キャラ・背景・小物をそれぞれ参照画像にして一枚にまとめる
- 局所編集:服の色だけ変える、背景だけ差し替えるといった部分修正
プロンプトでは「transparent background」「isolated subject」のように背景を持たない指示を明示すると、アルファの切れ目がきれいになりやすいです。
ライセンス上の注意(最重要)
- 初代Qwen-Image:Apache 2.0(商用可)
- Qwen-Image-2.1:Qwen Research License(非商用のみ・商用は開発元へ問い合わせ)
同人販売、クライアントワーク、広告素材など収益が発生する用途には使わないでください。商用で透過素材が必要な場合は、ComfyUIのGPT Image 2ノード(透過背景オプション、API課金)などが代替になります。
9月の他のニュースは「AI画像生成ニュース6選【2026年9月】」でまとめています。
まとめ
- ComfyUI v0.37.0以降へ更新してから導入
- Text Encode Qwen Image 2.1ノードの latentをそのまま使う
- VRAM不足は 量子化版+Cacheノード(cpu / int8)
- 保存は PNG でアルファを確認
- 非商用ライセンスなので検証用途に限定
よくある質問(FAQ)
Q. VRAM 12GBでも動きますか?
A. 量子化版とCacheノードのcpu/int4設定を組み合わせれば動く可能性はありますが、公式の推奨はフル精度で24GB以上です。まずは解像度を下げて試してください。
Q. 透過にならず背景が付いてしまいます。
A. JPEG保存だとアルファは消えます。PNGで保存しているか確認し、プロンプトに「transparent background」を入れてください。
Q. 初代Qwen-Imageのワークフローはそのまま使えますか?
A. 使えません。2.1は専用のText Encodeノードとモデル構成なので、テンプレートから組み直すのが確実です。
Q. LoRAは使えますか?
A. 2026年9月時点では2.1向けのLoRA資産はまだ少ない状況です。学習ツールの対応状況を確認してから取り組みましょう。