Qwen-Image-2.1: jeden model do generowania i edycji obrazów, trzy razy mniejszy i z węższą licencją
Jeden checkpoint Qwen-Image-2.1 obsługuje generowanie obrazów z tekstu i ich edycję. To zmiana wobec poprzedniej wersji, w której edycją zajmował się osobny model. Nowy Qwen ma 7 mld parametrów w 32 warstwach transformatora dyfuzyjnego (DiT), około trzy razy mniej niż Qwen-Image z 20 mld, a jego wagi są publicznie dostępne na licencji Qwen Research, która pozwala wyłącznie na badania i ewaluację.
Poprzedni Qwen-Image, wydany w sierpniu 2025 r., działał na Apache 2.0, a edycja obrazów była osobnym checkpointem Qwen-Image-Edit. Wersja 2.1 łączy oba zadania w jednej architekturze i jest mniejsza. Zmieniły się jednak warunki: na użytek komercyjny, dystrybucję wag albo modeli pochodnych potrzebna będzie osobna umowa z Qwenem. Publiczne wagi nie oznaczają tu swobodnego użycia.
7B w części dyfuzyjnej, 8B w enkoderze
Liczba 7 mld parametrów dotyczy samego transformatora. Pipeline ładuje dodatkowo enkoder Qwen3-VL o 8 mld parametrów, który zamienia instrukcje tekstowe i obrazy warunkujące na wspólną reprezentację. Łączny koszt obliczeniowy jest więc wyższy, niż sugeruje porównanie 7B kontra 20B.
Transformator ma architekturę jednoprzepływową z uwagą blokowo-przyczynową: tokeny tekstowe używają maski przyczynowej, a tokeny obrazów — maski dwukierunkowej w obrębie jednego obrazu. Warunki wejściowe, czyli tekst i obrazy referencyjne, są umieszczane przed zaszumionym latentem i nie mają do niego dostępu, więc ich klucze i wartości pozostają stałe przez cały denoising. Model liczy je raz i korzysta dalej z cache KV prefiksu — przy edycji z wieloma referencjami oszczędność rośnie wraz z ich liczbą.
Co potrafi
- Natywne RGBA — obraz z kanałem alfa przez 64-kanałowy VAE z kompresją przestrzenną 16x. Model generuje przezroczyste warstwy, edytuje je i wycina obiekty ze zdjęć.
- Edycja z wieloma referencjami — do 10 obrazów wejściowych w jednym wywołaniu.
- Lokalna kontrola — edycję można ograniczyć maską, okręgiem albo malowaną adnotacją, z zachowaniem tożsamości osób i wyglądu produktów.
- Rozdzielczość — domyślnie 2048 x 2048 i siedem proporcji obrazu, do 2752 x 1536.
Wynik z własnego testu
Na wewnętrznym benchmarku Qwen-Image-Bench model osiąga 60,28 punktu. To więcej niż Nano Banana 2.0 (59,82) i FLUX 2 Max (55,33), ale mniej niż sześć zamkniętych modeli — najwyżej stoi GPT Image 2.5 Sunburst z 67,01. Wynik pochodzi z testu przygotowanego przez samego producenta i nie został potwierdzony zewnętrznie.
Materiał nie zawiera też niezależnych pomiarów zużycia pamięci ani czasu generowania, więc trudno ocenić, jak model wypada poza środowiskiem Qwena. Nie wiadomo również, czy i kiedy pojawi się wersja na licencji komercyjnej.
