Ideogram выпустила версию 4.0 своей модели для генерации изображений по текстовому описанию в формате open-weight. Это значит, что веса модели доступны для загрузки, а запуск возможен на собственном оборудовании.
По данным Ideogram, новая версия получила нативное разрешение 2K, поддержку прозрачного фона, точное управление компоновкой через bounding boxes и улучшенную генерацию текста внутри изображений. Компания отмечает, что эти функции могут быть полезны для логотипов и постеров.
Также Ideogram сообщила, что в ближайшее время добавит редактируемый текст и слои. Модель можно дообучать на собственных данных.
Веса и код доступны для скачивания на GitHub. При этом для коммерческого использования требуется платная лицензия.
Согласно рейтингу DesignArena, Ideogram 4.0 занимает первое место среди всех open-weight моделей. Более высокие результаты показывают только закрытые модели OpenAI и Google.
В рейтинге text-to-image arena модель также заняла первое место в режиме quality и девятое место в общем зачёте.
На сайте Ideogram указано, что модель доступна через собственный hosted API в трёх уровнях качества.
Ideogram 4.0 также доступна в веб-версии и на платформах партнёров, включая Hugging Face, ComfyUI, fal, Runware, Magnific, Krea AI, Leonardo AI, Picsart, Cloudflare, Replicate, Gamma, Flora AI и Kittl.
В тесте The Decoder модель уверенно превзошла Midjourney v8, показала примерно сопоставимый результат с Flux, но уступила GPT-Image-2, Nano Banana Pro и Luma Uni-1.1. Издание уточняет, что этот вывод основан только на одном запросе.
В материале говорится, что тест в основном проверял следование промпту и способность модели передавать абстрактные концепции, которые вряд ли часто встречались в обучающих данных, например астронавта верхом на лошади. The Decoder подчёркивает, что окончательные выводы стоит делать на основе собственных тестов.
Источник: The Decoder, Ideogram, DesignArena, GitHub.






















