HAVE AI NEWS HAVE AI NEWS
en
Модели

Релиз GLM-5: открытая модель от Zhipu AI выходит на уровень лидеров в агентном программировании

Релиз GLM-5: открытая модель от Zhipu AI выходит на уровень лидеров в агентном программировании

Zhipu AI и Университет Цинхуа представили GLM-5 — мощную открытую MoE-модель на 744 млрд параметров, способную автономно писать код, вести глубокий веб-поиск и решать сложные многошаговые задачи наравне с проприетарными флагманами.

Команда Zhipu AI совместно со специалистами Университета Цинхуа опубликовала технический отчет о разработке GLM-5. Новая система возглавила рейтинги среди моделей с открытыми весами на платформах Artificial Analysis и LMArena (в категориях кодинга и работы с текстом), а также обошла ведущие проприетарные нейросети в тестах BrowseComp и HLE с внешними инструментами. Архитектура, веса и сопутствующий код выложены в открытый доступ на платформах GitHub и Hugging Face под свободной лицензией MIT.

Смена парадигмы: от «вайб-кодинга» к агентной инженерии

Создатели GLM-5 делают акцент на переходе от привычного «вайб-кодинга» (vibe coding) к полноценной агентной разработке. В первом случае программист вручную направляет чат-бота, отправляя фрагменты задач и самостоятельно проверяя каждую строчку кода, что плохо работает на крупных проектах. Агентный подход предполагает автономность: нейросеть принимает высокоуровневое ТЗ, изучает архитектуру проекта, вносит правки в кодовую базу, запускает тесты, устраняет баги и повторяет цикл до полной готовности задачи.

Архитектурные новшества: MoE, DSA и MLA

GLM-5 построена по архитектуре Mixture of Experts (MoE) и содержит 744 млрд параметров, из которых при обработке каждого токена активируются 40 млрд. Это более чем вдвое превосходит масштабы предшественницы GLM-4.5 (355B/32B).

Среди ключевых технологических оптимизаций:

  • DeepSeek Sparse Attention (DSA): разреженное внимание динамически выделяет наиболее релевантные токены вместо сплошной обработки всего контекста, снижая вычислительные затраты в 1,5–2 раза при работе с длинными окнами (до 128K–200K токенов).

  • MLA-256 с алгоритмом Muon Split: механизм сжатия контекстных ключей и значений до компактных векторов, предотвращающий падение качества за счет разделения матриц по отдельным проекционным головам.

  • Multi-Token Prediction (MTP): генерация сразу нескольких токенов за один проход, обеспечившая среднюю длину подтверждения 2,76 токена за такт (против 2,55 у DeepSeek-V3.2).

Эффективность применения различных вариаций механизма внимания отражена в сравнительном тестировании:

МетодHellaSwagMMLUC-EvalBBHHumanEval
GQA-8 (базовый)77.361.260.053.338.5
MLA77.361.559.748.933.5
MLA + Muon Split77.862.562.151.836.7
MLA-256 + Muon Split77.462.059.951.336.6

Методология обучения и асинхронный RL

Этап предварительного обучения охватил массив в 28,5 триллиона токенов, из которых 18T пришлись на общеязыковой корпус, а 9T — на код, математику и логические рассуждения. Контекстное окно последовательно расширялось в три шага: от 32K до 128K и 200K токенов.

Пайплайн дообучения (Post-Training) включает SFT и три последовательных уровня обучения с подкреплением (Reinforcement Learning): рассуждения (Reasoning), агентные сценарии (Agentic) и диалоговое выравнивание (General). Во избежание проблемы «катастрофического забывания» разработчики применили метод On-Policy Cross-Stage Distillation, дистиллируя знания сразу со всех промежуточных контрольных точек.

Чтобы исключить простой графических ускорителей во время многошаговых рассуждений агента, команда Zhipu разделила генерацию траекторий и расчет градиентов на независимые GPU-кластеры в рамках полностью асинхронного RL.

Для гибкого управления логикой внедрено три режима рассуждений:

  • Interleaved Thinking: генерация цепочки мыслей перед каждым действием или вызовом внешней функции;

  • Preserved Thinking: кэширование и повторное использование блоков рассуждений между диалоговыми репликами;

  • Turn-level Thinking: возможность включать или отключать модуль глубоких размышлений в зависимости от сложности запроса.

  • Результаты тестирования и бенчмарк CC-Bench-V2

    В тестах на поиск информации BrowseComp модель GLM-5 набрала 75,9% (у GPT-5.2 — 65,8%), а в HLE с использованием внешних утилит достигла 50,4%. В бенчмарке SWE-bench Verified модель подобралась к результатам закрытых систем Claude Opus 4.5 и GPT-5.2.

    Для проверки практических навыков разработки был разработан комплексный бенчмарк CC-Bench-V2. Он охватывает верстку фронтенда на популярных фреймворках (React, Vue, Next.js, Svelte), устранение багов в бэкенд-репозиториях (на Go, Rust, Python, C++, Java, TypeScript) и навигацию по проектам из тысяч файлов. Проверка интерфейсов выполнялась автоматически через связку Claude Code и Playwright (концепция Agent-as-a-Judge):

    • Показатель успешной сборки проектов (Build Success Rate) у GLM-5 достиг 98%.

    • По проверке отдельных критериев ТЗ (Check-item Success Rate) на React модель показала 71,0% (на уровне 70,7% у Claude Opus 4.5).

    • Сквозное выполнение задач от начала до конца (Instance Success Rate) составило 34,6% против 39,7% у Opus 4.5.

    Работа с длинным контекстом и прикладные задачи

    Для предотвращения деградации качества при многошаговом интернет-поиске введена система иерархического контекста (Hierarchical Context Management). Она сохраняет только последние 5 раундов вызова инструментов, при необходимости сбрасывая историю при переполнении лимитов, что подняло точность в BrowseComp с 55,3% до 75,9%.

    В задаче верстки HTML-презентаций через RL инженеры применили трёхуровневую систему наград (валидация стилей, проверка DOM-дерева в рендере и оценка баланса композиции). Устранение попыток модели обойти метрики (reward hacking) позволило поднять корректность формата 16:9 с 40% до 92%.

    Анонимный тест «Pony Alpha»

    Перед официальной публикацией разработчики анонимно разместили модель на сервисе OpenRouter под кодовым именем Pony Alpha. Пользователи высоко оценили возможности системы в программировании, ошибочно принимая её за неанонсированные версии Claude Sonnet 5 (25% голосов), DeepSeek (20%) или Grok (10%), что подтвердило флагманский уровень разработки.

    Требования к ресурсам и локальный запуск

    Полный объем исходных весов в формате BF16 составляет 1,65 ТБ. Для эффективного обслуживания в продакшене рекомендуется конфигурация из 8 ускорителей NVIDIA H200 (141 ГБ VRAM на карту) под управлением vLLM, SGLang или xLLM.

    Существуют и более доступные способы запуска:

    • Квантизация FP8: занимает вдвое меньше памяти и стабильно работает на 8× H100 или 8× H20 практически без потери точности.

    • Сжатие 2-bit / 1-bit GGUF (Unsloth): уменьшает объем до 241 ГБ (176 ГБ для 1-bit), что позволяет запустить модель на Mac с чипами M3/M4 Ultra (256 ГБ объединенной памяти) или рабочей станции с 24 ГБ VRAM и 256 ГБ системной ОЗУ с использованием оффлоадинга.

    • Облачные API: доступны через платформы DeepInfra ($0,80/$2,56 за миллион входных/выходных токенов), Fireworks, Novita и SiliconFlow.

    Оценки сообщества и текущие ограничения

    Специалисты отрасли отмечают выдающиеся способности GLM-5 в решении агентных задач и привлекательную стоимость инференса. Вместе с тем эксперты обращают внимание на ограничения: модель не поддерживает обработку изображений (text-only) и пока уступает Claude в глубине анализа контекста при возникновении нестандартных системных ошибок. В тестах со сложными симуляциями (Vending Bench 2) модель продемонстрировала чрезмерно агрессивное стремление к целевым метрикам, поэтому для полностью автономных критических систем эксперты рекомендуют сохранять контроль со стороны человека.

Автор: Konstantine Mozgovoy

Источник: neurohive.io

Комментарии

Войдите , чтобы оставить комментарий.

Пока нет комментариев.