Команда Zhipu AI совместно со специалистами Университета Цинхуа опубликовала технический отчет о разработке GLM-5. Новая система возглавила рейтинги среди моделей с открытыми весами на платформах Artificial Analysis и LMArena (в категориях кодинга и работы с текстом), а также обошла ведущие проприетарные нейросети в тестах BrowseComp и HLE с внешними инструментами. Архитектура, веса и сопутствующий код выложены в открытый доступ на платформах GitHub и Hugging Face под свободной лицензией MIT.
Смена парадигмы: от «вайб-кодинга» к агентной инженерии
Создатели GLM-5 делают акцент на переходе от привычного «вайб-кодинга» (vibe coding) к полноценной агентной разработке. В первом случае программист вручную направляет чат-бота, отправляя фрагменты задач и самостоятельно проверяя каждую строчку кода, что плохо работает на крупных проектах. Агентный подход предполагает автономность: нейросеть принимает высокоуровневое ТЗ, изучает архитектуру проекта, вносит правки в кодовую базу, запускает тесты, устраняет баги и повторяет цикл до полной готовности задачи.
Архитектурные новшества: MoE, DSA и MLA
GLM-5 построена по архитектуре Mixture of Experts (MoE) и содержит 744 млрд параметров, из которых при обработке каждого токена активируются 40 млрд. Это более чем вдвое превосходит масштабы предшественницы GLM-4.5 (355B/32B).
Среди ключевых технологических оптимизаций:
DeepSeek Sparse Attention (DSA): разреженное внимание динамически выделяет наиболее релевантные токены вместо сплошной обработки всего контекста, снижая вычислительные затраты в 1,5–2 раза при работе с длинными окнами (до 128K–200K токенов).
MLA-256 с алгоритмом Muon Split: механизм сжатия контекстных ключей и значений до компактных векторов, предотвращающий падение качества за счет разделения матриц по отдельным проекционным головам.
Multi-Token Prediction (MTP): генерация сразу нескольких токенов за один проход, обеспечившая среднюю длину подтверждения 2,76 токена за такт (против 2,55 у DeepSeek-V3.2).
Эффективность применения различных вариаций механизма внимания отражена в сравнительном тестировании:
| Метод | HellaSwag | MMLU | C-Eval | BBH | HumanEval |
|---|---|---|---|---|---|
| GQA-8 (базовый) | 77.3 | 61.2 | 60.0 | 53.3 | 38.5 |
| MLA | 77.3 | 61.5 | 59.7 | 48.9 | 33.5 |
| MLA + Muon Split | 77.8 | 62.5 | 62.1 | 51.8 | 36.7 |
| MLA-256 + Muon Split | 77.4 | 62.0 | 59.9 | 51.3 | 36.6 |
Методология обучения и асинхронный RL
Этап предварительного обучения охватил массив в 28,5 триллиона токенов, из которых 18T пришлись на общеязыковой корпус, а 9T — на код, математику и логические рассуждения. Контекстное окно последовательно расширялось в три шага: от 32K до 128K и 200K токенов.
Пайплайн дообучения (Post-Training) включает SFT и три последовательных уровня обучения с подкреплением (Reinforcement Learning): рассуждения (Reasoning), агентные сценарии (Agentic) и диалоговое выравнивание (General). Во избежание проблемы «катастрофического забывания» разработчики применили метод On-Policy Cross-Stage Distillation, дистиллируя знания сразу со всех промежуточных контрольных точек.
Чтобы исключить простой графических ускорителей во время многошаговых рассуждений агента, команда Zhipu разделила генерацию траекторий и расчет градиентов на независимые GPU-кластеры в рамках полностью асинхронного RL.
Для гибкого управления логикой внедрено три режима рассуждений:
Interleaved Thinking: генерация цепочки мыслей перед каждым действием или вызовом внешней функции;
Preserved Thinking: кэширование и повторное использование блоков рассуждений между диалоговыми репликами;
Turn-level Thinking: возможность включать или отключать модуль глубоких размышлений в зависимости от сложности запроса.
Показатель успешной сборки проектов (Build Success Rate) у GLM-5 достиг 98%.
По проверке отдельных критериев ТЗ (Check-item Success Rate) на React модель показала 71,0% (на уровне 70,7% у Claude Opus 4.5).
Сквозное выполнение задач от начала до конца (Instance Success Rate) составило 34,6% против 39,7% у Opus 4.5.
Квантизация FP8: занимает вдвое меньше памяти и стабильно работает на 8× H100 или 8× H20 практически без потери точности.
Сжатие 2-bit / 1-bit GGUF (Unsloth): уменьшает объем до 241 ГБ (176 ГБ для 1-bit), что позволяет запустить модель на Mac с чипами M3/M4 Ultra (256 ГБ объединенной памяти) или рабочей станции с 24 ГБ VRAM и 256 ГБ системной ОЗУ с использованием оффлоадинга.
Облачные API: доступны через платформы DeepInfra ($0,80/$2,56 за миллион входных/выходных токенов), Fireworks, Novita и SiliconFlow.
Результаты тестирования и бенчмарк CC-Bench-V2
В тестах на поиск информации BrowseComp модель GLM-5 набрала 75,9% (у GPT-5.2 — 65,8%), а в HLE с использованием внешних утилит достигла 50,4%. В бенчмарке SWE-bench Verified модель подобралась к результатам закрытых систем Claude Opus 4.5 и GPT-5.2.
Для проверки практических навыков разработки был разработан комплексный бенчмарк CC-Bench-V2. Он охватывает верстку фронтенда на популярных фреймворках (React, Vue, Next.js, Svelte), устранение багов в бэкенд-репозиториях (на Go, Rust, Python, C++, Java, TypeScript) и навигацию по проектам из тысяч файлов. Проверка интерфейсов выполнялась автоматически через связку Claude Code и Playwright (концепция Agent-as-a-Judge):
Работа с длинным контекстом и прикладные задачи
Для предотвращения деградации качества при многошаговом интернет-поиске введена система иерархического контекста (Hierarchical Context Management). Она сохраняет только последние 5 раундов вызова инструментов, при необходимости сбрасывая историю при переполнении лимитов, что подняло точность в BrowseComp с 55,3% до 75,9%.
В задаче верстки HTML-презентаций через RL инженеры применили трёхуровневую систему наград (валидация стилей, проверка DOM-дерева в рендере и оценка баланса композиции). Устранение попыток модели обойти метрики (reward hacking) позволило поднять корректность формата 16:9 с 40% до 92%.
Анонимный тест «Pony Alpha»
Перед официальной публикацией разработчики анонимно разместили модель на сервисе OpenRouter под кодовым именем Pony Alpha. Пользователи высоко оценили возможности системы в программировании, ошибочно принимая её за неанонсированные версии Claude Sonnet 5 (25% голосов), DeepSeek (20%) или Grok (10%), что подтвердило флагманский уровень разработки.
Требования к ресурсам и локальный запуск
Полный объем исходных весов в формате BF16 составляет 1,65 ТБ. Для эффективного обслуживания в продакшене рекомендуется конфигурация из 8 ускорителей NVIDIA H200 (141 ГБ VRAM на карту) под управлением vLLM, SGLang или xLLM.
Существуют и более доступные способы запуска:
Оценки сообщества и текущие ограничения
Специалисты отрасли отмечают выдающиеся способности GLM-5 в решении агентных задач и привлекательную стоимость инференса. Вместе с тем эксперты обращают внимание на ограничения: модель не поддерживает обработку изображений (text-only) и пока уступает Claude в глубине анализа контекста при возникновении нестандартных системных ошибок. В тестах со сложными симуляциями (Vending Bench 2) модель продемонстрировала чрезмерно агрессивное стремление к целевым метрикам, поэтому для полностью автономных критических систем эксперты рекомендуют сохранять контроль со стороны человека.
Комментарии
Войдите , чтобы оставить комментарий.
Пока нет комментариев.