НовостьРедакция Сразу

Z.ai отложила открытый релиз GLM‑5.3: модель оказалась слишком сильной в поиске уязвимостей

Z.ai отложила открытый релиз GLM‑5.3: модель оказалась слишком сильной в поиске уязвимостей

GLM-5.3: новая модель Z.ai делает ставку на сложное программирование и кибербезопасность

Компания Z.ai представила GLM-5.3 — новую языковую модель с открытыми весами, ориентированную на программирование, автономную работу с инструментами и выполнение многоэтапных задач.

Главное отличие модели заключается в том, что она использует ту же базовую архитектуру, что и GLM-5.2. Все улучшения были достигнуты за счёт масштабирования постобучения: увеличения числа тренировочных сред, разнообразия задач и вычислительных ресурсов.

Существенный рост в программировании

По данным Z.ai, GLM-5.3 стала одной из самых сильных моделей с открытыми весами для работы с кодом. На внутреннем тесте Z.ai Code Bench она показала результат на 50% выше, чем GLM-5.2.

Заметный рост зафиксирован и на публичных бенчмарках:

  • Terminal-Bench 3.0: 28,3% против 4,6% у GLM-5.2;
  • DeepSWE v1.1: 66,9% против 46,2%;
  • Agents’ Last Exam CLI: 28,5% против 23,8%;
  • CyberGym: 84,5% против 77,2%.

Разработчики подчёркивают, что модель обучали не только на отдельных упражнениях по программированию. Новые тренировочные среды имитируют полноценную работу инженеров: анализ существующего проекта, поиск узких мест, запуск экспериментов, исправление ошибок и проверку результата.

В одном из примеров модель должна работать с инфраструктурой машинного обучения, хранилищами, вычислительными кластерами и внутренней документацией. Её задача — самостоятельно найти проблему, внедрить оптимизацию и добиться измеримого ускорения без потери корректности.

Такой подход постепенно переводит ИИ-агента от режима помощника по отдельным командам к режиму исполнителя, способного брать на себя задачу целиком.

Меньше токенов — выше результат

Согласно тестам компании, GLM-5.3 не только лучше справляется со сложными задачами, но и использует меньше выходных токенов.

На максимальном уровне рассуждений модель достигла результата 34,5%, расходуя примерно 75 тысяч выходных токенов на задачу. Для сравнения, GLM-5.2 показывала 23,4% при расходе около 96 тысяч токенов.

На высоком уровне усилий GLM-5.3 получила 31,4% при примерно 50 тысячах токенов. Это выше результата Claude Opus 4.8 в аналогичном тесте, хотя модель Z.ai всё ещё уступает Claude Fable 5.

Неожиданный рост киберспособностей

Одним из самых заметных результатов GLM-5.3 стала динамика в задачах кибербезопасности. В процессе постобучения Z.ai добавила данные и среды для поиска уязвимостей.

Однако модель начала улучшаться не только в обнаружении отдельных ошибок, но и в построении многоэтапных цепочек эксплуатации.

На CyberGym GLM-5.3 получила 84,5%, опередив ряд сравниваемых моделей. На ExploitBench результат составил 54,4% — более чем в два раза выше показателя GLM-5.2, равного 24,4%.

В ExploitGym модель смогла выполнить 105 задач за два часа и 130 задач за шесть часов. У предыдущей версии результаты составили 29 и 39 задач соответственно.

При этом Z.ai признаёт, что на более сложных этапах эксплуатации закрытые модели пока сохраняют значительное преимущество. Чем ближе задача к полноценному использованию уязвимости, тем заметнее разрыв между GLM-5.3 и лидерами рынка.

Тысячи найденных уязвимостей

Z.ai также сообщила о тестировании своих моделей на реальных открытых кодовых базах совместно с несколькими командами по безопасности.

После экспертной проверки и удаления дубликатов было выявлено 2436 уязвимостей в 269 проектах. Из них 1097 относятся к категориям средней и высокой критичности.

Найденные проблемы затрагивают:

  • ядра операционных систем;
  • браузерные движки;
  • сетевые протоколы;
  • веб-приложения;
  • инфраструктурные проекты.

По данным компании, некоторые уязвимости оставались незамеченными десятилетиями. Самая старая из них была внесена в код примерно в 1981 году.

Z.ai ведёт публичный Security Disclosure Ledger, где отмечает статус найденных проблем: опубликованы ли они, находятся ли под эмбарго и получили ли CVE-идентификатор.

Важно учитывать, что приведённые результаты опубликованы самой Z.ai и требуют независимой проверки. Особенно это касается тестов безопасности и сравнения моделей на закрытых бенчмарках.

Основа масштабирования — фреймворк slime

Обучение GLM-5.3 проводилось с использованием открытого фреймворка slime. Он объединяет обучение с подкреплением, генерацию траекторий, работу с песочницами, математическими задачами и агентными средами.

Z.ai заявляет, что оптимизация инфраструктуры позволила увеличить пропускную способность обучения на длинных задачах программирования более чем в 2,3 раза.

Это дало возможность использовать более продолжительные сценарии и сложные среды при меньших ресурсных затратах.

Что изменилось в API

GLM-5.3 поддерживает три уровня интенсивности рассуждений:

  • low — облегчённый режим;
  • high — усиленный режим;
  • max — глубокое рассуждение.

Отключить рассуждения в новой версии нельзя. Для задач программирования Z.ai рекомендует использовать максимальный уровень:

{
  "model": "glm-5.3",
  "thinking": {
    "type": "enabled"
  },
  "reasoning_effort": "max"
}

Приложения, которые ранее передавали thinking.type: "disabled", потребуется обновить. Иначе запросы к GLM-5.3 будут завершаться ошибкой. Когда модель станет открытой Z.ai планирует опубликовать веса GLM-5.3 примерно через две недели после запуска — после завершения проверок безопасности и дополнительного усиления модели. GLM-5.3 показывает, что дальнейшее развитие ИИ всё больше зависит не только от размера базовой модели, но и от качества тренировочных сред. Чем ближе эти среды к реальной работе инженеров, тем лучше модели справляются с длинными задачами, где требуются планирование, самостоятельная проверка и ответственность за конечный результат. Оригинал: Z.ai — GLM-5.3 В Сразу совсем скоро модель появится.

Попробуйте прямо сейчас

Все модели — в одном чате, напрямую из России, оплата рублями. Первые ответы бесплатно.

Открыть чат →