finm137.wiki
Qwen-Image-2.1
最終更新:
kemonowikii
-
view
Qwen-Image-2.1について
- Qwen-Image-2.1について
- Qwen-Image-2.1とは
- 「Qwenファミリーで最も強力なオープンソース画像生成モデル」**
- 公開日
- 主な特徴
- 既存画像を入力して編集**
- 最大10枚の参照画像**
- 「腕時計だけ消す」**
- 「髪だけ赤くする」**
- 「服だけ変更する」**
- 透過RGBA画像生成
- RGBA画像を直接生成**
- 背景を透明化する**
- 口語的な編集指示
- Text Encoder
- Qwen3-VL 8B**
- 画像生成Transformer
- Single-Stream DiT**
- Prefix KV Cache
- Prefix KV Cache再利用**
- 入力画像+テキスト指示を最初に計算**
- KV Cacheとして保存**
- 以降の生成ステップで再利用**
- VAE
- 64-channel RGBA Autoencoder**
- 透明度Alpha Channel**
- 生成方式
- Flow Matching**
- Euler Discrete Scheduling**
- 40 Steps**
- プロンプト自動書き換え
- Prompt Rewriting Model**
- ComfyUI対応
- ComfyUIネイティブ対応**
- Diffusers対応
- QwenImage21Pipeline**
- vLLM-Omni
- SGLang
- LightX2V
- AMD GPU対応
- AMD Radeon GPU**
- 必要環境
- C++化について
- Python UIからモデルを呼び出す方式**
- C++ネイティブAIアプリ**
- Ibeeusasaaとの組み合わせ
- 複数画像生成AIをデッキのように使い分けるシステム**
- 推共エンジンとの相性
- ライセンス
- Qwen Research License Agreement**
- まとめ
- 画像生成**
- 画像編集**
- 複数参照画像**
- 局所編集**
- 同一性保持**
- 透過RGBA生成**
- Prompt Rewriting**
- 背景透明画像をネイティブ生成できる**
- 最大10枚の参照画像を使用できる**
- Qwen3-VLで画像と文章を同時理解する**
- Text-to-ImageとEditingが同一Pipeline**
- 2Kネイティブ生成**
- ComfyUI/Diffusers/vLLM/SGLangへDay-0対応**
- 画像を理解しながら生成・編集する統合型画像AI**
- 関連項目
Qwen-Image-2.1とは
Qwen-Image-2.1は、Alibaba系のQwenチームが2026年9月20日に公開した画像生成・画像編集モデル。
公式では、
「Qwenファミリーで最も強力なオープンソース画像生成モデル」**
として公開されている。
従来の画像生成専用モデルではなく、
- テキストから画像生成
- 画像編集
- 複数画像参照
- 局所編集
- 人物・商品の同一性保持
- 透過RGBA画像生成
- 被写体切り抜き
などを1つのモデルで扱えるのが特徴。
画像生成部分は約70億パラメータ(7B)で、32層のSingle-Stream DiTを採用している。
公開日
2026年9月20日。
同日に、
- Diffusers
- ComfyUI
- vLLM-Omni
- SGLang
- LightX2V
などがDay-0対応した。
つまりモデル公開とほぼ同時に、主要な画像生成・高速推論環境で利用できる状態になった。
主な特徴
テキストから画像生成
通常のText-to-Imageに対応。
文章で画像内容を指定すると、その内容をもとに画像を生成する。
公式ではネイティブ2K解像度をサポートしている。
標準では、
2048×2048
の1:1画像を生成可能。
推奨されるアスペクト比には、
- 1:1 2048×2048
- 4:3 2400×1792
- 3:4 1792×2400
- 3:2 2528×1696
- 2:3 1696×2528
- 16:9 2752×1536
- 9:16 1536×2752
などがある。
画像編集
Qwen-Image-2.1は画像生成だけでなく、
既存画像を入力して編集**
することもできる。
例えば、
- 服装変更
- 背景変更
- 髪色変更
- 物体削除
- 物体追加
- 構図変更
- 商品の編集
- キャラクター編集
など。
Text-to-ImageとImage Editingは同じQwenImage21Pipelineから利用できる。
最大10枚の参照画像
Qwen-Image-2.1は、
最大10枚の参照画像**
を利用した編集に対応している。
例えば、
- 人物
- 服
- 靴
- バッグ
- 帽子
などを別々の画像として渡し、それらをまとめた画像を生成することができる。
複数人物の写真をまとめてグループ写真にするような用途にも使える。
同一性保持
人物や商品の特徴を保持しながら画像編集する能力が強化されている。
例えば人物写真なら、
- 顔
- 髪型
- 服装
- 特徴
などをなるべく維持しながら、背景やポーズなどを変更できる。
商品画像でも形状や外観を保ちながら別のシーンに配置できる。
局所編集
編集したい場所だけを指定できる。
公式では、
- 丸で囲む
- 画像に描き込む
- マスク画像を使用する
といった方法に対応している。
例えば、
「腕時計だけ消す」**
「髪だけ赤くする」**
「服だけ変更する」**
といった編集が可能。
透過RGBA画像生成
Qwen-Image-2.1の大きな特徴の一つ。
通常のRGB画像だけでなく、
RGBA画像を直接生成**
できる。
つまり背景透明PNGをモデル側から直接生成できる。
例えば、
- ステッカー
- ゲーム素材
- UI素材
- キャラクター素材
- Live2D素材
- 画像合成用素材
- 3Dテクスチャ素材
などを背景透過状態で生成できる。
さらに既存画像から人物や物体だけを抜き出し、
背景を透明化する**
こともできる。
従来は背景除去AIを別に使うことが多かったが、Qwen-Image-2.1ではモデル内部で処理できる。
口語的な編集指示
画像編集では、
「空を夕焼けにして」
「このキャラクターを月の下で踊らせて」
「服だけ変更して」
「このキャラクターを月の下で踊らせて」
「服だけ変更して」
といった自然言語による編集に対応する。
Qwen3-VLをText Encoderとして使用しているため、文章だけでなく入力画像そのものも理解して処理する。
Text Encoder
Qwen-Image-2.1では、
Qwen3-VL 8B**
がText Encoderとして使用されている。
単純なテキストEncoderではなくVision-Language Modelを使用しており、
- 文章
- 参照画像
- 編集対象画像
などをまとめて理解する。
これによって複雑な画像編集や複数画像参照が可能になっている。
画像生成Transformer
画像生成部分は、
Single-Stream DiT**
を採用。
構成は、
- 32層
- 約7Bパラメータ
- Block-Causal Attention
- Mixed-Granularity Attention
など。
テキストと画像情報を同じストリーム内で処理する構造になっている。
Prefix KV Cache
Qwen-Image-2.1では、
Prefix KV Cache再利用**
が重要な高速化機能になっている。
通常の画像生成では、各Denoising Stepごとに入力画像やテキスト情報を再計算する場合がある。
Qwen-Image-2.1では、
入力画像+テキスト指示を最初に計算**
↓
KV Cacheとして保存**
↓
以降の生成ステップで再利用**
という方式を採用。
これによって無駄な再計算を減らしている。
VAE
Qwen-Image-2.1では、
64-channel RGBA Autoencoder**
を使用。
空間圧縮率は16倍。
RGBAをネイティブに扱うため、
透明度Alpha Channel**
もVAE内部で処理できる。
これが透過PNG生成を可能にしている。
生成方式
Schedulerには、
Flow Matching**
Euler Discrete Scheduling**
を使用。
公式標準値は、
40 Steps**
となっている。
Guidanceは標準では使用しない構成。
必要な場合はnegative_promptとtrue_cfg_scaleを設定してClassifier-Free Guidanceを有効にできる。
ただしCFGを使用すると1ステップあたりの計算量が増える。
プロンプト自動書き換え
Qwen-Image-2.1では、短いプロンプトを詳細なプロンプトへ変換するための、
Prompt Rewriting Model**
も公開されている。
Text-to-Image用:
Qwen/Qwen-Image-2.1-PE-T2I
Image Editing用:
Qwen/Qwen-Image-2.1-PE-I2I
どちらもQwen3.5-VL 9BをFine-Tuningしたモデル。
例えば、
「夜の街」
のような短い入力を、
- 構図
- 照明
- 背景
- 質感
- カメラ
- 雰囲気
などを含んだ詳細プロンプトへ拡張できる。
ComfyUI対応
Qwen-Image-2.1は公開初日から、
ComfyUIネイティブ対応**
している。
Text-to-ImageとImage Editing両方のサンプルワークフローが公開されている。
そのため現在はComfyUI経由で利用するユーザーも多い。
Diffusers対応
Hugging Face Diffusersでは、
QwenImage21Pipeline**
として利用できる。
Text-to-ImageとImage Editingの両方を同一Pipelineで扱える。
基本構造は、
QwenImage21Pipeline
↓
Qwen3-VL
↓
QwenImage21Transformer2DModel
↓
RGBA VAE
↓
画像
↓
Qwen3-VL
↓
QwenImage21Transformer2DModel
↓
RGBA VAE
↓
画像
となる。
vLLM-Omni
Qwen-Image-2.1はvLLM-Omniにも対応。
高速推論向けに、
- Prefix KV Cache
- CUDA Graph
- Step-wise Execution
- FP8量子化
- Tensor Parallel
- Ulysses Parallel
- Continuous Batching
- CPU Offload
などが利用できる。
サーバー形式で起動し、
API経由で画像生成することも可能。
SGLang
SGLang-DiffusionにもDay-0対応。
主な機能は、
- Text-to-Image
- Multi-Image Editing
- RGBA生成
- マルチGPU
- Memory Offload
- CUDA Graph
- 高速Kernel
など。
GPUサーバーで大量生成する用途にも向いている。
LightX2V
LightX2Vにも対応。
LightX2Vは画像・動画生成モデル向けの高速推論フレームワーク。
Qwen-Image-2.1では、
- Text-to-Image
- Image Editing
の両方を高速化できる。
Consumer GPUでのVRAM効率向上も重視されている。
AMD GPU対応
NVIDIAだけでなく、
AMD Radeon GPU**
でも動作可能。
ROCm
PyTorch
Diffusers
を利用して動かせる。
必要環境
公式Quick Startでは、
- PyTorch 2.4以上
- Transformers 5.17以上
- Diffusers
- Accelerate
- Pillow
などを使用。
Python環境では比較的簡単に導入できる。
C++化について
公式実装はPython+PyTorch+Diffusersが中心。
ただしQwen-Image-2.1自体の処理は、
- Transformer
- VAE
- Qwen3-VL
- Flow Matching
などのニューラルネットワーク処理なので、
- C++
- CUDA
- TensorRT
- ONNX Runtime
- ggml系ランタイム
などへ移植することも理論上可能。
その場合、
Python UIからモデルを呼び出す方式**
ではなく、
C++ネイティブAIアプリ**
として実装できる。
Ibeeusasaaとの組み合わせ
Ibeeusasaaへ搭載する場合、
Ibeeusasaa
↓
推共エンジン
↓
画像モデル選択
↓
Qwen-Image-2.1
↓
画像生成・画像編集
↓
生成結果解析
↓
必要なら再生成
↓
推共エンジン
↓
画像モデル選択
↓
Qwen-Image-2.1
↓
画像生成・画像編集
↓
生成結果解析
↓
必要なら再生成
という構成が考えられる。
さらに、
- Qwen-Image-2.1
- FLUX系
- SDXL系
- その他画像生成AI
などをModel Routerで切り替えることで、
複数画像生成AIをデッキのように使い分けるシステム**
にすることも可能。
推共エンジンとの相性
Qwen-Image-2.1には公式Prompt Rewriting機能がある。
そのためIbeeusasaa側で独自の推共エンジンを追加すれば、
ユーザー入力
↓
文脈理解
↓
重要条件抽出
↓
保持項目指定
↓
禁止変更指定
↓
詳細Prompt生成
↓
Qwen-Image-2.1
↓
文脈理解
↓
重要条件抽出
↓
保持項目指定
↓
禁止変更指定
↓
詳細Prompt生成
↓
Qwen-Image-2.1
という流れにできる。
例えば、
「このキャラの服だけ変えて」
という短い指示から、
- 顔を保持
- 髪型を保持
- 体型を保持
- 背景を保持
- ポーズを保持
- 服のみ変更
といった条件を自動追加できる。
ライセンス
Qwen-Image-2.1は、
Qwen Research License Agreement**
で公開されている。
Apache 2.0やMITではない。
そのため商用利用・再配布・製品組み込みを行う場合は、Qwen Research Licenseの内容を確認する必要がある。
まとめ
Qwen-Image-2.1は、
画像生成**
画像編集**
複数参照画像**
局所編集**
同一性保持**
透過RGBA生成**
Prompt Rewriting**
を1つにまとめたQwen系画像生成モデル。
特に、
背景透明画像をネイティブ生成できる**
最大10枚の参照画像を使用できる**
Qwen3-VLで画像と文章を同時理解する**
Text-to-ImageとEditingが同一Pipeline**
2Kネイティブ生成**
ComfyUI/Diffusers/vLLM/SGLangへDay-0対応**
という点が大きな特徴。
単なる画像生成モデルというより、
画像を理解しながら生成・編集する統合型画像AI**
に近いモデルとなっている。
関連項目
- Qwen
- Qwen3-VL
- Qwen-Image
- Qwen-Image-Edit
- ComfyUI
- Diffusers
- vLLM
- SGLang
- LightX2V
- PyTorch
- CUDA
- TensorRT
- Ibeeusasaa
- 生成AI
- 画像生成AI
- Vibe Coding









