База знаний
GLM-5.2 — открытая флагманская модель Z.ai с контекстом 1M
GLM-5.2 — открытая модель Z.ai с контекстом 1M токенов, сильным кодингом и MIT-лицензией. Разбор возможностей, подключения по API, цен и локального запуска.
СейчасЧто представляет собой GLM-5.2
- Что представляет собой GLM-5.2
- Основные возможности и ограничения
- Контекст 1M и суффикс [1m]
- Уровни reasoning effort
- Подтверждённые результаты бенчмарков
- Подключение к общему API
- Как проверить подключение
- Локальный запуск и требования к памяти
- Полезные сценарии
- Аудит большого репозитория
- Продолжительный рефакторинг
- Воспроизведение технической статьи
- Когда выбирать GLM-5.2
- Тарифы
- Ссылки на документацию и рецепты
- Следующий шаг
- Связанные материалы
GLM-5.2 — открытая модель Z.ai для длинных инженерных и агентных задач с контекстным окном до 1M токенов. По состоянию на 5 сентября 2026 года в официальной документации Z.ai актуальным флагманом линейки называется GLM-5.3; GLM-5.2 остаётся доступной через API и в виде открытых весов.
Что представляет собой GLM-5.2
GLM-5.2 — большая модель смеси экспертов (Mixture of Experts, MoE), разработанная Z.ai для программирования и продолжительных агентных задач. В ней около 744 млрд параметров всего, примерно 40 млрд активируются для каждого токена.
Модель получила контекстное окно до 1M токенов и архитектурный механизм IndexShare. Он переиспользует один индексатор на каждые четыре слоя разреженного внимания и, по данным репозитория Z.ai, сокращает вычисления на токен в 2,9 раза при длине контекста 1M.
В README репозитория, проверенном 5 сентября 2026 года, сказано, что GLM-5.3 использует ту же базовую модель, что и GLM-5.2, а улучшения получены на этапе постобучения. Поэтому GLM-5.2 разумно рассматривать как предыдущую доступную версию, а не как текущий флагман линейки.
Основные возможности и ограничения
| Параметр | Актуальное состояние |
| Архитектура | MoE, около 744 млрд параметров всего и примерно 40 млрд активных |
| Контекст | До 1M токенов; фактически доступный объём зависит от сервиса и конфигурации развёртывания |
| Усилие рассуждения | High и Max; Max используется по умолчанию |
| API | Chat Completions, потоковая выдача, вызов функций и JSON-ответы |
| Открытые веса | BF16 и FP8 опубликованы через Hugging Face и ModelScope |
| Локальный инференс | SGLang, vLLM, Transformers, KTransformers, Unsloth; для Ascend также указаны vLLM-Ascend и xLLM |
В официальном репозитории указана лицензия Apache-2.0. Перед коммерческим или модифицированным распространением конкретного чекпойнта проверьте условия лицензии в его карточке модели (model card).
Поддержка изображений в ZCode зависит от протокола, провайдера и настроек модели. Через OpenAI-совместимый endpoint ZCode считает GLM-5.2 моделью без поддержки изображений. Через Anthropic-совместимый endpoint ZCode может сохранить изображение в запросе и передать его сервису, но окончательное решение принимает сервер. Для предсказуемой работы используйте GLM-5.2 прежде всего как текстовую модель. Если поддержка не подтверждена, не отправляйте изображения с этой моделью.
Контекст 1M и суффикс [1m]
Официальный репозиторий описывает для GLM-5.2 устойчивое контекстное окно в 1M токенов. Однако имя модели и доступный контекст зависят от среды:
- в общем API Z.ai используется идентификатор
glm-5.2; - в ZCode имена моделей, заканчивающиеся на
[1m], обозначают фиксированное окно 1M и не редактируются; - при самостоятельном развёртывании доступная длина определяется памятью под кэш ключей и значений (KV-кэш), точностью и параметрами сервера.
В документации ZCode, проверенной 5 сентября 2026 года, указано, что автоматическое сжатие истории начинается до фактического заполнения окна. Система оставляет место для ответа и служебный запас около 34 тысяч токенов суммарно, поэтому для окна 1M сжатие начинается примерно на 966 тысячах токенов. Номинальный миллион нельзя считать гарантированным объёмом пользовательского ввода.
Уровни reasoning effort
Для локального запуска README репозитория указывает два значения поля reasoning_effort: high и max. high рассчитан на баланс глубины рассуждения и задержки. max предназначен для максимальной глубины и используется по умолчанию.
Официальная документация общего API дополнительно описывает совместимые значения: low и medium преобразуются в high, xhigh — в max, а none и minimal отключают рассуждение. Явное отключение также доступно через thinking.type=disabled.
Для воспроизводимых запросов передавайте нужный режим явно: сторонний провайдер или самостоятельное развёртывание могут поддерживать другой набор значений.
Подтверждённые результаты бенчмарков
В README официального репозитория, проверенном 5 сентября 2026 года, приведены следующие результаты:
| Бенчмарк | GLM-5.2 | GLM-5.1 |
| Terminal-Bench 2.1 | 81.0 | 62.0 |
| SWE-bench Pro | 62.1 | 58.4 |
Для Terminal-Bench 2.1 тот же README указывает 85.0 для Claude Opus 4.8. Сопоставимое значение Claude для SWE-bench Pro в этом README не приведено.
Эти значения показывают заметный прирост относительно GLM-5.1, но не заменяют проверку на вашем наборе задач. В тех же материалах GLM-5.3 описана как более сильная модель для сложного программирования и продолжительных агентных задач.
Подключение к общему API
Для общего API с оплатой из баланса или пакета ресурсов используется конечная точка API (endpoint) https://api.z.ai/api/paas/v4/chat/completions. Создайте API-ключ в разделе API Keys на Z.AI Open Platform и храните его в переменной окружения.
Формат примеров ниже сверён с официальными API-документами и Quick Start, проверенными 5 сентября 2026 года.
export ZAI_API_KEY="ваш-api-key"
curl --request POST --url "https://api.z.ai/api/paas/v4/chat/completions" --header "Content-Type: application/json" --header "Authorization: Bearer ${ZAI_API_KEY}" --data '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Предложи план рефакторинга модуля и перечисли проверки результата"
}
],
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
"temperature": 1.0,
"stream": false
}'Официальный Python SDK:
pip install zai-sdkimport os
from zai import ZaiClient
client = ZaiClient(api_key=os.environ["ZAI_API_KEY"])
response = client.chat.completions.create(
model="glm-5.2",
messages=[
{
"role": "user",
"content": "Предложи план рефакторинга модуля и перечисли проверки результата",
}
],
thinking={"type": "enabled"},
reasoning_effort="high",
temperature=1.0,
)
print(response.choices[0].message.content)https://api.z.ai/api/coding/paas/v4, а общий баланс обслуживается через https://api.z.ai/api/paas/v4. Эти конечные точки не взаимозаменяемы.Как проверить подключение
После тестового запроса проверьте четыре признака:
- HTTP-запрос завершился кодом
200. - В обычном текстовом ответе присутствуют
model, массивchoicesи текст вchoices[0].message.content. - В объекте
usageвозвращается расход входных и выходных токенов. - При вызове функций
finish_reasonполучает значениеtool_calls, а параметры функции приходят вmessage.tool_calls.
Материал основан на документации и репозиториях; фактический запрос из этой редакционной проверки не выполнялся.
Локальный запуск и требования к памяти
Официальный репозиторий публикует BF16- и FP8-чекпойнты. В рецепте vLLM с датой обновления 12 июля 2026 года указана стабильная версия vLLM 0.23.0. Если одновременно нужны вызов функций и многотокенное предсказание (MTP), авторы рецепта советуют актуальную ветку main.
Рецепт приводит такие ориентиры:
- FP8: минимальная видеопамять около 893 ГБ; типовая конфигурация — восемь H200 или H20;
- полный контекст 1M для FP8 показан на восьми B200 с FP8 KV-кэшем;
- BF16 требует около 1786 ГБ и многосерверного развёртывания;
- вариант MXFP4 для AMD MI355X указывает минимум около 446 ГБ.
Это параметры конкретного рецепта, а не универсальная гарантия. Реальный предел контекста зависит от числа одновременных последовательностей, точности KV-кэша и запаса памяти. Начинайте с меньшего --max-model-len, затем увеличивайте его после нагрузочного теста без ошибок нехватки памяти.
Полезные сценарии
Аудит большого репозитория
Передайте структуру проекта, ключевые модули и тесты, затем запросите карту архитектуры, зависимости и список рисков. Проверяйте результат по ссылкам на реальные файлы и воспроизводимым командам тестов. Сценарий не подходит, если репозиторий превышает доступное окно или содержит данные, которые нельзя отправлять выбранному провайдеру.
Продолжительный рефакторинг
Дайте модели требования, ограничения и критерии готовности, затем поручите подготовить план и выполнять изменения небольшими шагами. После каждого этапа проверяйте diff, сборку и тесты. Большой контекст помогает сохранять историю решений, но не заменяет контроль версий и автоматические проверки.
Воспроизведение технической статьи
Передайте текст исследования и исходные параметры эксперимента. Попросите собрать минимальную реализацию, зафиксировать зависимости и сравнить полученный результат с заявленной метрикой. Итогом должны быть запускаемый код, журнал эксперимента и явное описание расхождений. Если исходные параметры или данные статьи неполны, проверяемое сравнение не получится.
Когда выбирать GLM-5.2
GLM-5.2 подходит, если нужны открытые веса, большой контекст и контроль над собственным развёртыванием. Для нового облачного проекта сначала сравните её с GLM-5.3: текущая модель получила дополнительное постобучение и позиционируется Z.ai как более сильная в программировании и продолжительных агентных задачах.
Для коротких запросов 1M-контекст обычно не даёт практического преимущества. Для изображений, аудио или видео выбирайте модель и endpoint с явно подтверждённой поддержкой нужной модальности.
Тарифы
Здесь не приводится полная тарифная таблица API и коэффициенты списания Coding Plan: переданные актуальные источники не дают их полной раскладки именно для GLM-5.2. Перед запуском в продакшене проверьте действующую страницу Pricing и правила конкретного плана. Общий API и Coding Plan используют разные конечные точки и механизмы учёта.
Самостоятельное развёртывание GLM-5.2 имеет смысл для команд, которым нужны контроль над инфраструктурой и продолжительные задачи на большом контексте. До выбора конфигурации отдельно оцените объём весов, KV-кэш и ожидаемую параллельность запросов.
Ссылки на документацию и рецепты
- Репозиторий GLM-5
- API Chat Completions
- Быстрый старт API и SDK
- Настройка моделей и endpoints в ZCode
- Веса GLM-5.2 на Hugging Face
- Веса GLM-5.2 на ModelScope
- Рецепт развёртывания GLM-5.2 для vLLM
Следующий шаг
Для сравнения с другой открытой моделью большого контекста прочитайте MiniMax M3 — открытые веса и миллионный контекст.
Связанные материалы
- Статья: MiniMax M2.7 на Mac Studio
- Блог: Kimi K2.6 и долгие агентные задачи
- База знаний: Kimi K2.6
Если вы выбираете модель для локального запуска или долгих агентных задач, эти материалы помогают сопоставить требования к инфраструктуре и рабочие сценарии.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
MiniMax M3 — первая открытая модель с frontier-кодингом, контекстом 1M токенов и нативной мультимодальностью. MSA-архитектура, цены и способы запуска.