Alibaba sonunda yeni bombası Qwen-Image-2.1’i duyurdu. Bu yeni görsel üretim modeliyle birlikte sıfırdan içerik hazırlama ve mevcut görüntüleri değiştirme süreçleri aynı çatı altında toplandı. Lafı uzatmadan detaylara geçelim…
Açık kaynak olarak yayınlanan Qwen-Image-2.1‘de üretim ile düzenleme işleri birleştirilmiş. Birleştirilmiş derken yani artık tek modelde yer alıyorlar. Çiçeği burnunda yapay zeka aracı, 32 Single-Stream DiT katmanı ve 7 milyar parametre içeriyor. Alibaba’nın açıklamasına bakarsak modelin mimarisi kalite ve maliyet arasında denge kurmak üzerine ayarlanmış.

KV önbelleği sayesinde talimatlar ilk adımda işlenip sonraki aşamalarda doğrudan kullanılabiliyor. Böylece gereksiz hesaplamaların önüne geçiliyor ve bellek tüketimi azalıyor. KV ise “Key-Value”, yani “Anahtar-Değer” ifadesinin kısaltması demek. En basit haliyle modelin ihtiyaç duyduğu bazı bilgileri geçici olarak saklayan bir sistem. Bu arada şunu da belirtelim, Qwen-Image-2.1 performans olarak Nano Banana’nın önünde bulunuyor.

Şeffaf Görseller Doğrudan Destekleniyor
Qwen-Image-2.1 kullanıcının isteğine göre normal ya da alfa çıktı hazırlayabiliyor. Saydam katmanlar düzenleyebiliyor, yüz ifadesini değiştirebiliyor, yeni metin ekliyor veya gerçek fotoğraftaki kişiyi bir RGBA katmanı olarak çıkarabiliyor. Bu şekilde tasarım öğelerini sonraki kompozisyonlarda yeniden kullanmak daha kolay hâle gelmiş.

Referanslar Temel Alınıyor
Düzenleme kısmında sınır genişlemiş. Sistem aynı anda 10 referans görseli kullanabiliyor ve farklı öğeleri tek kompozisyonda bir araya getirebiliyor. Bunun yanında model, görselin yalnızca belirli bir bölümünde değişiklik yapılmasına da izin veriyor. Düzenlenecek alan daire, boyalı işaret veya ayrı bir maske ile seçilebiliyor. İstenen bölge üzerinde değişiklik yapılırken sahnenin geri kalanı korunuyor. Panorama, infografik ve storyboard üretimi de olmazsa olmazlar arasında. Tipografi, portre ışığı ve ince ayrıntılar da iyileştirilmiş.





