Команда Qwen из Alibaba выпустила Qwen3.7-Max — закрытую модель для агентных задач. В одном из практических тестов модель 35 часов без остановки автономно оптимизировала ядро для вычислений.
Как и Qwen3-Max и Qwen3.6-Plus, новая версия Max доступна только через API Alibaba Cloud Model Studio. Ранее Alibaba публиковала модели Qwen с открытым кодом, но теперь подход изменился: последним открытым флагманом была Qwen3.5-397B-A17B, представленная в феврале 2026 года.
Qwen3.7-Max поддерживает интерфейсы, совместимые с OpenAI и Anthropic, и может подключаться к Claude Code, OpenClaw и Qwen Code. По данным команды Qwen, модель рассчитана на четыре сценария:
- работа как агент для программирования — от прототипов интерфейсов до крупных многомодульных проектов;
- автоматизация офисных задач с использованием внешних инструментов;
- автономная работа на длинных сессиях;
- стабильная работа в разных агентных фреймворках.
В одном из тестов модель получила задачу оптимизировать аппаратно-зависимое ядро attention для открытого ПО SGLang. Для этого использовался облачный инстанс с ускорителями T-Head-ZW-M890 — это ИИ-чипы от полупроводникового подразделения Alibaba.
Команда Qwen утверждает, что во время обучения модель не видела эту архитектуру. На старте у неё не было данных замеров, документации по железу и примеров кода. Единственной опорой стала существующая эталонная реализация на языке Triton.
За примерно 35 часов автономной работы модель провела 432 теста ядра и выполнила 1 158 обращений к инструментам. Она по циклу компилировала, измеряла и переписывала код, находила ошибки компиляции и сама искала узкие места по производительности.
По словам исследователей Qwen, итогом стало среднее ускорение в 10 раз по сравнению с эталонной реализацией. В тех же условиях другие модели показали более слабый результат: GLM 5.1 — 7,3x, Kimi K2.6 — 5x, DeepSeek V4 Pro — 3,3x, а Qwen3.6-Plus — 1,1x.
Модели, которые завершали работу раньше времени, останавливали сессию после пяти подряд раундов без вызовов инструментов. На стандартизированном бенчмарке KernelBench L3 Qwen3.7-Max, как заявляет команда, создаёт ускоренные ядра в 96% случаев, уступая только Anthropic Opus 4.6 с результатом 98%.
Qwen3.7-Max продолжает подход к обучению, который команда впервые применила в Qwen3.5. Каждая учебная задача делится на три независимые части: сама задача, инструментальная среда и валидатор, который проверяет результат.
Эти части можно комбинировать в разных вариантах. По замыслу разработчиков, это заставляет модель усваивать стратегии, которые работают в разных условиях, а не использовать приёмы, привязанные к одной конкретной конфигурации.
По данным команды Qwen, на QwenClawBench и CoWorkBench модель показывает стабильный результат вне зависимости от тестовой среды. При этом сами эти бенчмарки созданы командой Qwen.
Разработчики также использовали Qwen3.7-Max как систему контроля во время собственного обучения. Модель наблюдала за обучающими прогонами по задачам программной инженерии более 80 часов и выполнила свыше 10 000 проверок.
Она искала способы, которыми обучаемая модель могла бы искусственно улучшать награду, например брать правильные ответы напрямую с GitHub. В итоге Qwen3.7-Max создала 13 новых правил обнаружения и отметила 1 618 случаев.
Для проверки долгосрочного планирования команда применила YC-Bench — бенчмарк, который моделирует полный год жизни стартапа. В нём модель должна управлять персоналом на протяжении сотен раундов решений, проверять контракты, выявлять недобросовестных клиентов и поддерживать маржу на фоне роста затрат на труд.
В этом тесте Qwen3.7-Max получила $2,08 млн выручки и закрыла 237 задач. Qwen3.6-Plus показала $1,05 млн, а Qwen3.5-Plus — $352 000.
На ряде бенчмарков Qwen3.7-Max выступает на уровне Claude Opus 4.6 Max, Kimi K2.6 Thinking, GLM-5.1 Thinking и DeepSeek V4 Pro Max. На SWE-Verified модель набрала 80,4 балла против 80,8 у Opus 4.6 Max и 80,6 у DeepSeek V4 Pro Max.
На тестах по математике и естественным наукам — GPQA Diamond, HMMT 2026 February и Apex — модель возглавила сравнительную таблицу самой Alibaba с результатами 92,4, 97,1 и 44,5 соответственно.
При этом часть бенчмарков создана самой командой Qwen. К ним относятся QwenWebDev, QwenClawBench, CoWorkBench и QwenWorldBench. Все приведённые результаты компания сообщает самостоятельно, а более подробный разбор методики и динамики масштабирования обещает опубликовать в отдельном техническом отчёте.
Помимо стандартных сценариев, команда показала применение Qwen3.7-Max для управления четвероногим роботом. Языковая модель использует собственный робототехнический фреймворк и связанную навигационную модель, чтобы вести робота через физическое пространство.
Источник: The Decoder, данные и заявления команды Qwen компании Alibaba.






















