Qwen-Image-2.1 випередила Nano Banana 2, ставши першою відкритою моделлю-лідером

Qwen-Image-2.1 випередила Nano Banana 2, ставши першою відкритою моделлю-лідером 4

Alibaba продовжує тиснути на ринок опенсорсного штучного інтелекту: команда Qwen випустила Qwen-Image-2.1 — модель для генерації та редагування зображень з відкритими вагами, яка, за словами розробників, обходить більшість закритих аналогів, маючи всього 7 мільярдів параметрів. Про реліз повідомляє The Decoder, а деталі архітектури розкриває офіційний блог Qwen.

Qwen-Image-2.1 випередила Nano Banana 2, ставши першою відкритою моделлю-лідером 5

Менше параметрів, більше можливостей

Головна теза релізу — модель не стала більшою, вона стала компактнішою. Візуальний генеративний компонент Qwen-Image-2.1 налічує лише 7 млрд параметрів (32 шари Single-Stream DiT) — це втричі менше, ніж 20 млрд у попередній версії Qwen-Image 1.0. При цьому модель об’єднує в одному пайплайні одразу кілька функцій:

  • генерацію зображень за текстовим промптом;
  • редагування наявних зображень;
  • нативну підтримку прозорих зображень у форматі RGBA — модель може як генерувати графіку з прозорим фоном, так і виділяти об’єкт із фотографії на окремий прозорий шар;
  • роботу одразу з десятьма референсними зображеннями — для групових портретів, віртуальної примірки одягу чи дизайну інтер’єру;
  • локальне редагування за допомогою кіл, масок або намальованих від руки позначок.

Модель також підтримує нативну генерацію у роздільній здатності 2K і, за словами розробників, покращену типографіку та світлотіні в портретах.

Швидкість за рахунок архітектурних хитрощів

За прискорення інференсу, особливо при роботі з кількома референсними зображеннями одночасно, відповідає змішана гранулярність уваги (mixed-granularity attention) у поєднанні з повторним використанням KV-кешу префіксу. Простими словами: текстові інструкції та вхідні зображення обчислюються й кешуються один раз на першому кроці, а не перераховуються заново на кожному наступному — це суттєво зменшує навантаження при мультиреференсному редагуванні.

Qwen-Image-2.1 випередила Nano Banana 2, ставши першою відкритою моделлю-лідером 6

Завдяки такій оптимізації модель здатна працювати навіть на відносно потужних споживчих відеокартах — розробники наводять як приклад GeForce RTX 3090.

Місце в рейтингу: сьома з 29, але перша серед відкритих

За внутрішнім бенчмарком Qwen-Image-Bench модель отримала загальний бал 60,28 — це сьоме місце з 29 протестованих моделей. Попереду неї — шість закритих рішень, лідирує GPT Image 2.5 Sunburst із результатом 67,01. При цьому Qwen-Image-2.1 випередила Nano Banana 2.0 (59,82) і залишила позаду абсолютно всі відкриті моделі в списку, включно з набагато більшою FLUX 2 Max на 32 млрд параметрів.

Варто зауважити: бенчмарк — власний і поки що не підтверджений незалежними тестами, а кількість параметрів закритих конкурентів невідома, тому коректно порівнювати розмір моделі можна лише серед відкритих рішень.

Доступ є, але з застереженням щодо ліцензії

Модель уже доступна на Hugging Face, GitHub і Model Scope, там-таки є демоверсія для тестування. Проте ліцензія моделі — дослідницька і прямо забороняє комерційне використання: компаніям, які захочуть застосувати Qwen-Image-2.1 у бізнесі, доведеться окремо звертатися до Qwen за комерційною ліцензією.

Що обговорює Hacker News

Обговорення на HN зібрало десятки коментарів, і найгарячіша тема — саме ліцензія. Користувач jfoster звернув увагу, що попередні моделі Qwen зазвичай виходили під ліцензією Apache, тоді як нова версія має значно жорсткіші умови використання.

Коментатор gregoriol підтвердив тенденцію: останні опенсорсні моделі для генерації зображень з ліцензією Apache 2.0 виходили ще у 2025-му, а тепер у Qwen «некомерційне використання» стало нормою. Користувач jfoster додав ще одну деталь із самого тексту ліцензії: використання матеріалів у комерційних цілях без окремої ліцензії прямо заборонене, тож зрештою вартість використання моделі залежатиме від рішень Alibaba, а не просто від витрат на хмарну інфраструктуру.

Дехто пішов ще далі в критиці: юзер gunalx зауважив, що нова відкрита модель навіть не перевершує власну закриту Qwen3 Image від тієї ж компанії, яка вже встигла застаріти.

Утім, загальний настрій спільноти лишається доброзичливим. Коментатор d2kx назвав команду Qwen «найрізноманітнішою» серед усіх китайських лабораторій — за його словами, з нею може позмагатися хіба що Gemini/DeepMind. А користувач hgufj прямо подякував китайським лабораторіям за відкритість моделей: «Якби це залежало від американців, нам довелося б платити шалені гроші за доступ через API».

Технічна частина дискусії зосередилась навколо запуску моделі локально — користувачі обговорювали варіанти через ComfyUI, vLLM, SGLang та diffusion.cpp, оскільки стандартний llama.cpp поки що не підтримує генерацію зображень напряму. Один із коментаторів (trains39472) із захопленням зауважив, що 7-мільярдна дифузійна модель тепер рендерить китайські, японські й корейські ієрогліфи краще, ніж це робить сама Windows.

Були й скептичні голоси: користувач BlackGlory натякнув на характерний жовтуватий відтінок згенерованих зображень — так званий «piss filter», який асоціюють із ChatGPT, натякаючи, що модель могла бути дистильована із зображень, згенерованих конкурентом. Втім, це припущення так і лишилося без доказів. Інший коментатор (trentor) відзначив протилежне — на його думку, у Qwen нарешті «полагодили VAE», який роками стримував якість зображень у попередніх версіях моделі.

Нагадаємо, під час експерименту локальна модель Qwen 3.5-9B впоралася з 95% робочих задач розробника.

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *