Команда Qwen из Alibaba представила Qwen3.7-Plus — мультимодальную модель, созданную на базе текстовой Qwen3.7. Она объединяет визуальное восприятие с агентными функциями, включая написание кода и работу с инструментами.
В компании называют модель мультимодальным интерактивным гибридным агентом. По данным Qwen, она умеет распознавать сцены из реального мира, читать содержимое экрана, работать с графическими интерфейсами, писать код по визуальным шаблонам и выполнять задачи в мобильных приложениях от начала до конца. Клики по интерфейсу и команды в терминале выполняются в одном агентном цикле.
Для демонстрации возможностей команда использовала Qwen3.7-Plus при создании приложения для изучения английских слов. Как утверждает Qwen, агент работал более 11 часов, сгенерировал свыше 10 тыс. строк кода и выполнил более 1 тыс. агентных вызовов.
В этот процесс вошли подготовка требований, автоматическая генерация кода, установка, создание тест-кейсов, тестирование через графический интерфейс, параллельные сценарии проверки и отдельное управление версиями.
Во второй демонстрации агент был нацелен на настольные приложения. По данным Qwen, он самостоятельно воссоздал нативное приложение Stocks для macOS: разобрал структуру интерфейса, сгенерировал код на SwiftUI, подключил внешний API для биржевых данных в реальном времени, собрал приложение и сам провёл десять функциональных тестов, включая поиск цен и работу фильтров.
Третий сценарий показывает браузерного агента через расширение Qwen for Chrome с боковой панелью. После разрешения пользователя модель переходит в агентный режим и выполняет задачи в облачной консоли. В качестве примера Qwen приводит покупку самой дешёвой доступной виртуальной серверной инстанции с настройкой образа, хранилища и групп безопасности.
По словам команды, в следующем задании агент также берёт на себя масштабирование и обслуживание этой инфраструктуры.
Опубликованные Qwen бенчмарки показывают, что модель особенно сильна в работе с графическими интерфейсами. В тестах AndroidWorld и ScreenSpot Pro Qwen3.7-Plus заметно опережает GPT-5.4 (xhigh), Opus 4.6 Max и Gemini 3.1 Pro. Также модель лидирует в задачах, связанных с терминалом и долгим планированием действий.
В классических мультимодальных тестах результаты неоднородны. Qwen3.7-Plus показывает лучшие результаты в части проверок на визуальное рассуждение, но уступает Gemini 3.1 Pro и GPT-5.4 в более трудных научных задачах, включая MedXpertQA-MM. В текстовых задачах команда оценивает её уровень как сопоставимый с флагманскими моделями, но без преимущества по всем тестам.
Qwen3.7-Plus поддерживает протокол Anthropic API и работает напрямую с Claude Code, OpenClaw и собственным Qwen Code от Alibaba. В API также есть функция preserve_thinking, которая сохраняет содержимое рассуждений из предыдущих частей диалога. Команда Qwen прямо рекомендует использовать этот режим для агентных задач.
Помимо обработки изображений, модель поддерживает анализ видео и дорожных сцен. В Qwen считают, что это делает её базой для встраиваемых систем и автономного транспорта.
Qwen3.7-Plus доступна через Alibaba Cloud Model Studio. Как и текстовая модель Qwen3.7-Max, это проприетарный продукт без открытых весов.
| Модель | Цена за 1 млн входных токенов | Цена за 1 млн выходных токенов |
| Qwen3.7-Plus | $0.40 | $2.40 |
| Qwen3.7-Max | $2.50 | $7.50 |
Тариф Plus заметно дешевле Max: примерно в шесть раз по входным токенам и более чем в три раза по выходным. В материале также отмечается, что этот уровень цен ниже, чем у ряда западных флагманских моделей.
Источник: The Decoder.






















