Alibaba представила Qwen3.7-Max для агентов

Команда Qwen из Alibaba выпустила Qwen3.7-Max — закрытую модель для агентных задач. В одном из практических тестов модель 35 часов без остановки автономно оптимизировала ядро для вычислений.

Как и Qwen3-Max и Qwen3.6-Plus, новая версия Max доступна только через API Alibaba Cloud Model Studio. Ранее Alibaba публиковала модели Qwen с открытым кодом, но теперь подход изменился: последним открытым флагманом была Qwen3.5-397B-A17B, представленная в феврале 2026 года.

Qwen3.7-Max поддерживает интерфейсы, совместимые с OpenAI и Anthropic, и может подключаться к Claude Code, OpenClaw и Qwen Code. По данным команды Qwen, модель рассчитана на четыре сценария:

  • работа как агент для программирования — от прототипов интерфейсов до крупных многомодульных проектов;
  • автоматизация офисных задач с использованием внешних инструментов;
  • автономная работа на длинных сессиях;
  • стабильная работа в разных агентных фреймворках.

В одном из тестов модель получила задачу оптимизировать аппаратно-зависимое ядро attention для открытого ПО SGLang. Для этого использовался облачный инстанс с ускорителями T-Head-ZW-M890 — это ИИ-чипы от полупроводникового подразделения Alibaba.

Команда Qwen утверждает, что во время обучения модель не видела эту архитектуру. На старте у неё не было данных замеров, документации по железу и примеров кода. Единственной опорой стала существующая эталонная реализация на языке Triton.

За примерно 35 часов автономной работы модель провела 432 теста ядра и выполнила 1 158 обращений к инструментам. Она по циклу компилировала, измеряла и переписывала код, находила ошибки компиляции и сама искала узкие места по производительности.

По словам исследователей Qwen, итогом стало среднее ускорение в 10 раз по сравнению с эталонной реализацией. В тех же условиях другие модели показали более слабый результат: GLM 5.1 — 7,3x, Kimi K2.6 — 5x, DeepSeek V4 Pro — 3,3x, а Qwen3.6-Plus — 1,1x.

Модели, которые завершали работу раньше времени, останавливали сессию после пяти подряд раундов без вызовов инструментов. На стандартизированном бенчмарке KernelBench L3 Qwen3.7-Max, как заявляет команда, создаёт ускоренные ядра в 96% случаев, уступая только Anthropic Opus 4.6 с результатом 98%.

Qwen3.7-Max продолжает подход к обучению, который команда впервые применила в Qwen3.5. Каждая учебная задача делится на три независимые части: сама задача, инструментальная среда и валидатор, который проверяет результат.

Эти части можно комбинировать в разных вариантах. По замыслу разработчиков, это заставляет модель усваивать стратегии, которые работают в разных условиях, а не использовать приёмы, привязанные к одной конкретной конфигурации.

По данным команды Qwen, на QwenClawBench и CoWorkBench модель показывает стабильный результат вне зависимости от тестовой среды. При этом сами эти бенчмарки созданы командой Qwen.

Разработчики также использовали Qwen3.7-Max как систему контроля во время собственного обучения. Модель наблюдала за обучающими прогонами по задачам программной инженерии более 80 часов и выполнила свыше 10 000 проверок.

Она искала способы, которыми обучаемая модель могла бы искусственно улучшать награду, например брать правильные ответы напрямую с GitHub. В итоге Qwen3.7-Max создала 13 новых правил обнаружения и отметила 1 618 случаев.

Для проверки долгосрочного планирования команда применила YC-Bench — бенчмарк, который моделирует полный год жизни стартапа. В нём модель должна управлять персоналом на протяжении сотен раундов решений, проверять контракты, выявлять недобросовестных клиентов и поддерживать маржу на фоне роста затрат на труд.

В этом тесте Qwen3.7-Max получила $2,08 млн выручки и закрыла 237 задач. Qwen3.6-Plus показала $1,05 млн, а Qwen3.5-Plus — $352 000.

На ряде бенчмарков Qwen3.7-Max выступает на уровне Claude Opus 4.6 Max, Kimi K2.6 Thinking, GLM-5.1 Thinking и DeepSeek V4 Pro Max. На SWE-Verified модель набрала 80,4 балла против 80,8 у Opus 4.6 Max и 80,6 у DeepSeek V4 Pro Max.

На тестах по математике и естественным наукам — GPQA Diamond, HMMT 2026 February и Apex — модель возглавила сравнительную таблицу самой Alibaba с результатами 92,4, 97,1 и 44,5 соответственно.

При этом часть бенчмарков создана самой командой Qwen. К ним относятся QwenWebDev, QwenClawBench, CoWorkBench и QwenWorldBench. Все приведённые результаты компания сообщает самостоятельно, а более подробный разбор методики и динамики масштабирования обещает опубликовать в отдельном техническом отчёте.

Помимо стандартных сценариев, команда показала применение Qwen3.7-Max для управления четвероногим роботом. Языковая модель использует собственный робототехнический фреймворк и связанную навигационную модель, чтобы вести робота через физическое пространство.

Источник: The Decoder, данные и заявления команды Qwen компании Alibaba.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai