Мой блог
Z.ai выпустила модель GLM-5.3 с улучшенными навыками программирования и кибербезопасности

Компания Z.ai представила модель GLM-5.3. Примечательно, что новинка функционирует на той же базовой модели объемом 743 миллиарда параметров, что и предыдущая версия GLM-5.2. Все заявленные улучшения достигнуты исключительно за счет масштабирования этапа постобучения: разработчики увеличили количество рабочих сред, разнообразили их типы и продлили общую продолжительность тренировки. Основные изменения зафиксированы в двух ключевых направлениях. Наиболее заметный рост производительности в программировании наблюдается на тестах с долгосрочным планированием, где показатель Terminal-Bench 3.0 увеличился с 4.6 до 28.3 пункта. В сфере кибербезопасности результаты превзошли изначальные ожидания создателей, а бенчмарк CyberGym достиг отметки в 84.5%. Открытые веса модели пока не опубликованы.
Доступность и практическое применение
На текущий момент модель доступна лишь частично: ее можно задействовать через фирменный API Z.ai, тарифный план GLM Coding Plan, а также платформу ZCode. Полноценные веса разработчики планируют выпустить примерно через две недели после официального анонса, после завершения процедур проверки безопасности и дополнительной настройки.
Стартапы и инженерные команды среднего уровня могут начать работу с решением незамедлительно через Coding Plan или интерфейс программирования приложений. В то же время предприятия, подчиняющиеся строгим правилам локализации данных или регламентам проверки сторонних поставщиков, должны дождаться релиза весов. Наибольшую практическую пользу и одновременно наибольшую регуляторную нагрузку ощутят на себе производители средств безопасности и управляемые поставщики услуг безопасности (MSSP).
Среди ключевых отраслей, где востребована новинка, выделяются разработчики инструментов для программирования, облачная инфраструктура, прикладная безопасность, инженерные отделы финтех-компаний и сферы электронной коммерции, а также производители операционных систем, браузерных движков и сетевых стеков. Спектр задач охватывает рефакторинг на уровне репозиториев, долгосрочные CLI-агенты, триаж сбоев CI, обнаружение уязвимостей методом белого ящика, разбор дампов падений и аудит защищенности исходного кода.
Результаты в программировании
Показатели в сфере написания кода демонстрируют значительный прирост по сравнению с предшественником. Тест Terminal-Bench 3.0 поднялся с 4.6 до 28.3, а DeepSWE v1.1 вырос с 46.2 до 66.9. Бенчмарк Agents’ Last Exam для интерфейса командной строки показал увеличение с 23.8 до 28.5 пункта. В комплексной оценке GDPval-AA v2, охватывающей 44 различные профессии, GLM-5.3 набирает 1,769 балов.
Согласно внутренней системе тестирования Z.ai Code Bench, зафиксировано 50-процентное улучшение относительно GLM-5.2. Система демонстрирует результативность на уровне 31.4% при генерации примерно 50 000 выходных токенов на одну задачу. Для сравнения, Claude Opus 4.8 набирает 29.5% при объеме в 120 000 токенов, тогда как Claude Fable 5 сохраняет лидерство с показателем 39.5% при максимальной нагрузке. Специалисты Z.ai утверждают, что использование частных бенчмарков минимизирует риски загрязнения данных. При этом на общедоступных независимых наборах тестов новинка в ряде сложных задач уступает моделям GPT-5.6 Sol и Fable 5. Все приведенные числовые значения предоставлены разработчиком, а параметры окружения, длина контекста и настройки семплирования детально задокументированы.
Результаты в сфере кибербезопасности
Специалисты Z.ai отмечают, что данный прорыв носил непреднамеренный характер. Изначально в тренировочный массив добавили данные по поиску уязвимостей в расчете на улучшение логики выявления единичных ошибок, однако по мере масштабирования обучения возможности модели начали лавинообразно расти. Нейросеть стала формировать логически связанные планы действий, охватывающие целые цепочки эксплуатации уязвимостей.
Показатель CyberGym, тестирующий обнаружение и проверку брешей на основе исходного кода (white-box), увеличился с 77.2% до 84.5%. Это позволяет модели опережать Mythos 5 с ее 83.8% и GPT-5.6 Sol, набирающую 83.6%. Тест ExploitBench, требующий анализа первопричин и создания работающего эксплойта, показал рост с 24.4% до 54.4%, в то время как Mythos 5 фиксирует результат на уровне 78.0%. В рамках испытаний на платформе ExploitGym модель GLM-5.3 успешно справляется со 105 задачами за два часа и со 130 задачами за шесть часов. Для сравнения, прошлая версия GLM-5.2 решала лишь 29 и 39 задач соответственно, тогда как Mythos 5 демонстрирует показатели в 181 и 247 задач.
Общая закономерность остается неизменной: чем глубже в цепочку эксплуатации уязвимостей погружен бенчмарк, тем сильнее заметен отрыв от GLM-5.2, хотя разрыв с закрытыми передовыми моделями в некоторых аспектах также сохраняется.
Ключевые выводы
- GLM-5.3 использует ту же базовую модель, что и GLM-5.2, а все улучшения достигнуты за счет масштабирования процесса постобучения.
- Результаты в Terminal-Bench 3.0 выросли с 4.6 до 28.3, а в DeepSWE v1.1 — с 46.2 до 66.9.
- Бенчмарк кибербезопасности CyberGym достиг отметки 84.5%, опередив Mythos 5 (83.8%) и GPT-5.6 Sol (83.6%).
- Показатель ExploitBench увеличился более чем вдвое и составил 54.4%, однако здесь модель пока отстает от Mythos 5 (78.0%).
- Официальные веса модели будут открыты примерно через две недели после завершения проверок безопасности и необходимого укрепления защитных механизмов.
Источник: marktechpost.com

