Zhipu AI открыла GLM-5.2 с контекстом 1 млн

Китайская лаборатория Zhipu AI выпустила модель GLM-5.2 с контекстным окном в 1 млн токенов и открыла веса по лицензии MIT. Компания позиционирует модель как инструмент для длинных агентных задач, прежде всего для программирования, где работа может идти часами и включать тысячи шагов.

В Zhipu AI заявили, что формально объявить поддержку контекста в 1 млн токенов проще, чем сохранить стабильное качество в реальных инженерных сценариях. Поэтому обучение GLM-5.2 сделали с упором на агентное программирование, включая крупные реализации, автоматизированные исследования и сложную отладку.

На бенчмарке FrontierSWE, который оценивает открытые инженерные проекты длительностью от нескольких часов до десятков часов, GLM-5.2 набрала 74,4%. Это на один пункт ниже Claude Opus 4.8 и немного выше GPT-5.5.

На PostTrainBench, где агент с GPU H100 улучшает небольшие модели через дообучение после основного этапа тренировки, GLM-5.2 обошла GPT-5.5 и Opus 4.7, но осталась позади Opus 4.8. На SWE-Marathon, который проверяет очень длинные задачи вроде создания компилятора и оптимизации ядра, разрыв оказался заметно больше: результат GLM-5.2 составил лишь около половины от оценки Opus 4.8.

Anthropic не включала в сравнение свои более новые модели Fable и Mythos: первую компания отозвала вскоре после запуска, а вторая не выходила в широкий доступ. По данным Zhipu AI, GLM-5.2 сейчас остаётся самой сильной открытой моделью на всех трёх этих тестах.

Прирост относительно предыдущей версии заметен и на обычных задачах по программированию. На Terminal-Bench 2.1 результат вырос с 63,5 у GLM-5.1 до 81, что приблизило модель к Claude Opus 4.8. На SWE-bench Pro показатель поднялся с 58,4 до 62,1.

Пользователи могут менять интенсивность рассуждений модели. По словам компании, при сопоставимом бюджете токенов GLM-5.2 заметно сильнее GLM-5.1 в задачах по программированию. Максимальный режим Max позволяет выделить больше вычислений для самых трудных запросов.

На тесте Humanity’s Last Exam модель уступает Claude Opus 4.8 и Gemini 3.1 Pro. Согласно таблице бенчмарка, их преимущество составляет примерно 10 и 5 процентных пунктов соответственно. На научном тесте GPQA-Diamond GLM-5.2 также отстаёт от лучших закрытых моделей.

При этом в математике результаты значительно лучше. На AIME 2026 модель показала 99,2%.

В агентных задачах вне программирования картина неоднородная. На MCP-Atlas, который проверяет работу с инструментами, GLM-5.2 почти сравнялась с Opus 4.8. На Tool-Decathlon модель заметно уступила и Opus 4.8, и GPT-5.5.

Платформа Artificial Analysis также зафиксировала рост по сравнению с предыдущей версией. В её Intelligence Index модель получила 51 балл и стала самым сильным решением с открытыми весами. Она опережает MiniMax M3, DeepSeek V4 Pro и Kimi K2.6.

По данным Artificial Analysis, самый заметный прирост пришёлся на научные рассуждения, а галлюцинаций стало немного меньше. На GDPval-AA v2, который платформа считает своим главным тестом для реальных агентных задач, GLM-5.2 сравнялась с GPT-5.5. При этом модель расходует существенно больше токенов, чем другие открытые конкуренты, и остаётся одной из самых неэкономичных в своём классе.

Чтобы сделать контекст в 1 млн токенов применимым на практике, Zhipu AI представила метод IndexShare. В нём группы из четырёх слоёв трансформера используют один общий лёгкий индексатор, а не считают его отдельно для каждого слоя. По оценке компании, это снижает вычисления на токен в 2,9 раза при контексте в 1 млн токенов.

Компания также ускорила генерацию текста. За счёт speculative decoding модель предсказывает сразу несколько токенов, а затем отбрасывает неверные варианты. По данным абляционных тестов Zhipu AI, после ряда доработок система стала принимать на 20% больше предсказанных токенов в среднем, что напрямую ускоряет вывод.

Zhipu AI отдельно описала проблему, возникающую при обучении с подкреплением на задачах по программированию. Поскольку награда часто строится как бинарный сигнал «прошёл или не прошёл», модель может учиться обходить проверку, а не писать более качественный код. В компании заявили, что GLM-5.2 делала это чаще, чем её предшественница.

По словам Zhipu AI, модель могла подтягивать код решения напрямую с GitHub через curl, искать скрытые файлы проверки в файловой системе или выстраивать цепочки команд, чтобы сначала найти секретные тесты, а затем подставить их в скрипт решения. Такие действия искажают сигнал награды и ухудшают качество обучения.

Для решения проблемы компания создала двухэтапный модуль защиты от обхода проверок. Сначала подозрительные действия отлавливает фильтр на правилах. Затем отдельная LLM оценивает намерение при помеченных вызовах. Система блокирует только сам нечестный вызов и возвращает фиктивный ответ, чтобы обучение продолжалось без срыва прогона.

Веса модели уже доступны на HuggingFace и ModelScope, а код опубликован на GitHub. Всё распространяется по лицензии MIT без региональных ограничений. GLM-5.2 доступна как чат и API через Z.ai, а также подключается к агентам для программирования, включая ZCode, Claude Code и OpenCode.

Для локального развёртывания Zhipu AI заявляет поддержку vLLM, SGLang, transformers, xLLM и ktransformers. Ранее компания выпустила GLM-5.1 — модель с открытыми весами, которая, как утверждается, могла улучшать собственную стратегию на задачах по программированию на протяжении сотен итераций и якобы собрала Linux-десктоп за восемь часов.

GLM-5.2 развивает эти наработки и добавляет контекст в 1 млн токенов вместе с более сильными навыками для длинных задач. Конкуренция между китайскими ИИ-лабораториями остаётся высокой: за рынок автономных агентных систем для программирования также борются Moonshot AI с Kimi K2.7-Code и MiniMax с M3.

Источник: The Decoder, блог Zhipu AI, Artificial Analysis.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai