AlibabaのQwenチームは2026年9月20日、新しい画像生成AIモデル「Qwen-Image-2.1」を公開しました。

Qwen-Image-2.1は、画像生成と画像編集を1つのモデルに統合した70億パラメータ(7B)の画像AIモデルです。Qwenは「Qwen-Imageシリーズで最もバランスが取れ、コスト効率の高いモデル」と位置付けており、モデルウェイトも公開されています。

Qwen-Image-2.1とは?

Qwen-Image-2.1の特徴は、単純に文章から画像を作るだけではありません。

テキストからの画像生成に加え、既存画像の編集、複数画像を参照した生成、人物や商品の保持、局所的な修正などを1つのモデルで処理できます

モデル規模は7B。近年の大型画像生成モデルと比べると比較的コンパクトで、Qwenはマルチ画像入力時の推論速度も大幅に高速化したと説明しています。

特に大きな特徴が、最大10枚の参照画像を同時に利用できることです。

例えば、人物の三面図を渡して同じキャラクターを使ったストーリーボードを生成したり、複数の商品写真を参照しながら新しい広告画像を作ったりできます。

人物の顔や商品の形状を維持しながら編集する「参照画像への忠実性」も重視されています。

透過画像をそのまま生成・編集できる

もう一つ特徴的なのが、RGBAによる透過画像へのネイティブ対応です。

一般的な画像生成AIでは、背景を透明にしたい場合、一度画像を生成してから背景除去AIなどを使う必要があります。

Qwen-Image-2.1では、最初から透明な背景を持つ画像を生成したり、透明部分を維持したまま画像を編集できます。

ロゴ、商品素材、Webデザイン、広告素材など、後から別の画像へ合成する用途では実用性の高い機能です。

画像編集能力も強化

Qwen-Image-2.1は局所編集にも対応しています。

公式デモでは、画像内の複数箇所を色付きの円で指定し、

「青い円の腕時計を削除する」 「赤い円の髪を黒くする」 「緑の円の服をグレーの半袖リネンパジャマに変える」

といった複数の編集を一度に実行しています。

さらにQwenによれば、前世代と比較して文字表現や人物画像の美しさも改善されています。パノラマ、インフォグラフィック、バーチャル試着など幅広い画像形式を想定しています。

ベンチマークは?

ここは注意が必要です。

Qwenは公式発表で、Qwen-Image-2.1について「7Bという軽量モデルながら、多くのクローズドソースモデルを上回る」と説明しています。

一方、公開時点ではQwen自身が運営する画像生成ベンチマーク「Qwen-Image-Bench」に、Qwen-Image-2.1の数値はまだ追加されていません。

現在のQwen-Image-Benchでは、Qwen Image 2.0 Proが総合57.84を記録していますが、2.1は評価対象18モデルの中に含まれていません。したがって、GPT Image 2やNano Banana 2.0などと同一条件で比較できるQwen-Image-2.1の公式スコアは、現時点では未公開です。

項目Qwen-Image-2.1
パラメータ数7B
画像生成対応
画像編集対応
参照画像最大10枚
透過RGBA対応
局所編集対応
公開形態Open Weights
公開ベンチマーク数値現時点では未掲載

つまり、現段階では「非常に強い7Bモデル」というQwen側の主張とデモは確認できますが、第三者が再現できる数値比較については今後の更新を見る必要があります。

誰が使える?いつから使える?

Qwen-Image-2.1は、2026年9月20日からモデルウェイトが一般公開されています。

9月17日にはModelScopeで50人限定の早期アクセスが募集されていましたが、その後、正式にOpen Weightsとして公開されました。

開発者や研究者はHugging FaceやModelScopeからモデルを取得し、自分のGPUやクラウド環境上で実行できます。

ただし、「Open Weights」は「商用利用を含めて無制限に使える」という意味ではありません。公開直後のモデルではライセンス条件も重要になるため、サービスや商品の制作に利用する場合は、最新のモデルカードに掲載されているライセンスを確認する必要があります。

どうやって使う?

現時点で最も分かりやすい方法の一つが、Hugging Faceの「Diffusers」を利用する方法です。

モデルIDは、

Qwen/Qwen-Image-2.1

です。

Diffusersにはすでに「QwenImage21Pipeline」が実装されており、文章から画像を作るText-to-Imageだけでなく、画像を渡して編集するImage-conditioned Editingにも対応しています。複数の画像をリストとして渡すこともできます。

推奨設定は40ステップ、CFG Guidanceなし(true_cfg_scale=1.0)となっています。

また、ComfyUI側でもQwen Image 2.1が対応モデルとして掲載されており、Pythonコードを直接書かない画像生成ワークフローも利用できます。

API料金はいくら?

ここも公開直後なので注意が必要です。

2026年9月20日時点では、Alibaba Cloud Model Studioの公式料金表にQwen-Image-2.1のAPI料金は掲載されていません。

今回の発表で明確に公開されたのはモデルウェイトであり、Qwen-Image-2.1専用の公式ホスト型API料金はまだ確認できません。

参考までに、前世代の「qwen-image-2.0」はAlibaba Cloud Model Studioの国際向けAPIで1画像あたり0.035ドル、Qwen Image 2.0 Proは1画像あたり0.075ドルです。

モデルAPI料金
Qwen Image 2.0$0.035 / 画像
Qwen Image 2.0 Pro$0.075 / 画像
Qwen-Image-2.1現時点で公式API料金未掲載

一方、Qwen-Image-2.1はモデルウェイトが公開されているため、自分のGPUやクラウドGPUで動かす場合、Qwenに対して「1枚いくら」というAPI利用料を支払う必要はありません。

その代わり、GPUの購入費用やクラウドGPUの利用料金が実質的な生成コストになります。

Qwen-Image-2.1の重要な点

Qwen-Image-2.1で重要なのは、単純な最高画質競争だけではありません。

7Bという比較的小さなモデルに、画像生成、画像編集、最大10枚の参照画像、局所編集、人物・商品の保持、透過RGBAまでまとめたことが、このモデルの特徴です。

特にローカル環境や自社サービスに画像生成AIを組み込みたい開発者にとって、巨大なクローズドモデルだけに依存しない選択肢になります。

ただし、公開されたばかりのため、Qwen-Image-Bench上の正式な数値、公式ホストAPIの料金、商用利用を含むライセンス条件については、今後の情報更新を確認する必要があります。