Alibaba раскрыла детали модели Qwen-Image-2.0

Alibaba раскрыла технические детали Qwen-Image-2.0 и объяснила, как команда снизила затраты на обучение и ускорила генерацию. В отчёте выделены три ключевых изменения: более сильное сжатие изображений через VAE, переработанный image transformer и отдельный модуль, который разворачивает короткие пользовательские запросы в подробные описания.

В отчёте говорится, что модель работает не с исходными пикселями, а с компактным латентным представлением, которое создаёт вариационный автокодировщик, или VAE. Чем сильнее сжатие на этом этапе, тем быстрее и дешевле становится обучение самой генеративной модели.

Большинство открытых моделей уменьшают изображение в восемь раз по каждой стороне. Как отмечает Alibaba, Qwen-Image-2.0 использует 16-кратное пространственное сжатие. Для сравнения, FLUX.1-dev и HunyuanVideo работают с более мягким коэффициентом.

Обычно такое сжатие ухудшает мелкие детали, но команда Qwen использовала два приёма. Первый — skip connections, которые передают точную визуальную информацию в обход узких слоёв. Второй — настройка латентного пространства во время обучения так, чтобы оно лучше отражало смысловые структуры; при этом, по данным отчёта, это давление на представление сильнее в начале обучения и слабее на поздних этапах.

Ещё одно отличие — отказ от дискриминатора, который часто применяют в VAE для сравнения реальных и восстановленных изображений. Команда называет этот компонент «во многом избыточным» при большом масштабе и указывает, что он может делать обучение менее стабильным.

Даже при более сильном сжатии VAE модели показал более высокие результаты восстановления на стандартном датасете ImageNet, чем конкуренты с меньшим коэффициентом сжатия.

Архитектура Qwen-Image-2.0 построена на transformer, который обрабатывает текстовые и визуальные токены в одном потоке. Текстовая часть задаётся через Qwen3-VL — vision-language model, веса которой остаются замороженными.

В самом transformer Alibaba изменила два узла. Сначала команда упростила внутренний механизм масштабирования: вместо умножения сигнала на обучаемый коэффициент и добавления смещения сохранилось только умножение. Затем блоки feed-forward между слоями внимания заменили на SwiGLU.

По данным отчёта, переход на SwiGLU связан с конкретной проблемой обучения. Когда модель совместно осваивает текст и изображение, некоторые внутренние значения могут резко расти, а нейроны — рано входить в насыщение. Исследователи больших языковых моделей называют это massive activations. SwiGLU помогает удерживать значения в рабочем диапазоне.

Для сложных изображений, таких как постеры или инфографика, нужны подробные промпты. Но пользователи часто вводят короткие и расплывчатые запросы. Для этого Alibaba добавила отдельный модуль на базе Qwen3.5-9B, который превращает краткий ввод в более детальное описание.

Обучение этого модуля шло необычным способом. Вместо ручной разметки команда взяла готовые подробные описания изображений и шаг за шагом убирала из них детали — освещение, текстуры и компоновку — пока текст не становился похожим на обычный пользовательский запрос. Каждый такой шаг автоматически создавал сигнал обучения для восстановления удалённой информации.

Далее модуль обучали в два этапа. Сначала — на синтетических парах коротких и полных запросов. Затем он генерировал варианты промптов, замороженный генератор изображений создавал по ним результаты, а сам модуль дообучали так, чтобы итоговые изображения были качественными и соответствовали исходному намерению пользователя.

На финальном этапе согласования с человеческими предпочтениями команда использовала пять reward-моделей. Три из них оценивают новые изображения по эстетике, точности следования промпту и качеству портретов. Ещё две проверяют отредактированные изображения: насколько они выполняют инструкцию и не слишком ли уходят от оригинала.

В схеме reinforcement learning есть и практическое упрощение. Classifier-free guidance, который обычно повышает резкость и качество вывода у diffusion-моделей, применяют только при генерации обучающих примеров, но не в самом цикле оптимизации. По словам Alibaba, это снижает вычислительные затраты без заметной потери качества.

Команда также описала автоматизированный конвейер для работы с обучающими данными. Если тесты или отзывы пользователей выявляют неудачные результаты, система относит проблему к одной из трёх причин. Если ошибка связана с reinforcement learning, корректируют reward-сигнал.

Если модели не хватает знаний, автоматический поиск проверяет датасет на пробелы и добавляет новые целевые примеры. Если слабым звеном оказывается модуль промптов, его переобучают. По данным отчёта, люди подключаются только на финальной проверке и фильтрации.

Обучение проходит через шесть этапов по мере роста разрешения изображений — от 256 до 2048 пикселей. Доля данных для обычной генерации и редактирования тоже меняется: с 9:1 на ранних этапах до 7:3 на поздних.

Чтобы ускорить инференс, Alibaba применила дистилляцию. Обычные diffusion-модели создают изображение за десятки шагов удаления шума, а облегчённая версия Qwen-Image-2.0 требует четыре шага вместо 40. При этом дистилляция повторяет не весь путь генерации, а только финальный результат; в отчёте сказано, что визуальное качество остаётся сопоставимым.

Эти детали дополняют первоначальный анонс модели, который Alibaba сделала ранее в этом году. На старте Qwen-Image-2.0 был доступен только как закрытая API-бета в Alibaba Cloud и как демо внутри Qwen Chat.

В слепых сравнениях на внутренней платформе Arena модель Alibaba находится рядом с лидерами, но уступает им. Первое место занимает OpenAI GPT-Image-2, второе — Google Nano Banana Pro. В материале отмечается, что разрыв между лучшими системами по фотореализму, рендерингу текста и точному редактированию уже невелик.

Вопрос об открытом выпуске Qwen-Image-2.0 пока остаётся без ответа. Веса модели ещё не опубликованы, хотя первую генеративную модель Qwen для изображений Alibaba выпустила по лицензии Apache 2.0 примерно через месяц после запуска. Qwen-Image-2.0 также пополняет список китайских image-моделей, которые делают упор на точную генерацию текста, включая LongCat image от Meituan и GLM image от Zhipu AI.

Источник: The Decoder, технический отчёт Alibaba о Qwen-Image-2.0.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai