アリババ・テンション・クアンチームは最近、オープンソースコミュニティに注目を浴びる新製品を登場させた。画像生成および編集モデル「Qwen-Image-2.1」が公開された。驚きなのはそのパラメータ数である。視覚生成コンポーネントは70億のパラメータのみで、自社の評価基準において市場に出ている多くの非オープンソースモデルを上回った。チームの自信は明らかだが、第三者による独立した評価はまだ到着していないため、この成果は時間とともに検証される必要がある。さらに実用的な点としては、ハードウェアの要件が低く、RTX3090のような一般的なエンドユーザー向けGPUでも動かすことができる。
「Qwen-Image-2.1」の最大の強みは「類似項目の統合」だ。公式の紹介画像では、それぞれの顔が異なる人物の写真から来ているが、モデルは丁寧なパズル職人のようにそれらを自然に結合して一枚のグループ写真にまとめている。これは透明画像のネイティブサポートにより可能であり、生成されるのは通常のRGB画像ではなく、透明チャネルを持つRGBA形式である。これにより、ユーザーは物体を個別に抽出でき、透明レイヤー上で直接テキストを変更し、レイアウトや後工程を省略できる。
参照画像の処理能力も非常に優れている。一度に最大10枚の参照画像を処理でき、グループ写真の合成、仮試着、部屋のデザインなど、すべてがこのフレームワーク内で動作する。局所的な修正が必要な場合、全体を再描画する必要はない。囲むように輪を描いたり、マスクを塗ったり、手でいくつかのタグを追加するだけで、モデルはどの部分を変更すべきかを理解する。チームによると、構造上の変更とKVキャッシュの再利用により、推論速度が大幅に向上しており、特に参照画像の数が増えると、スピードアップの効果がより明確になる。
導入のハードルも低い。モデルはHugging Face、GitHub、魔搭コミュニティ(ModelScope)で同時に公開され、オンラインデモも用意されている。唯一注意すべき点はライセンスである。これは研究用の許可であり、商用利用は禁止されている。企業ユーザーが実際のプロジェクトに適用したい場合は、千問チームに別途商業用ライセンスを申請する必要がある。つまり、個人的な遊びや学術的な探求は自由であるが、実際に収益を上げるビジネスを行うには、まずライセンスの承認を得なければならない。
VIP会員