Z.ai раскрыла, как GLM-5.3 помогла запустить инфраструктуру для GLM-5.3-Flash
2026-09-17 компания Z.ai опубликовала разбор запуска GLM-5.3-Flash на кластере из более чем 100 000 китайских ускорителей. По данным вендора, значительную часть адаптации и оптимизации системы выполнил программный агент на базе GLM-5.3: путь от первого запуска модели до готовности к промышленной нагрузке занял менее двух недель. Производительность системы относительно исходной конфигурации выросла примерно в 3 раза; независимых замеров пока нет.
Инженеры применили квантование W8A8, смешанные форматы INT8, FP8 и BF16 для памяти, разделение слоёв и раздельную обработку этапов запросов. Инфраструктура поддерживает контекст до 1 млн токенов и работу с несколькими типами данных. Z.ai утверждает, что эффективность использования оборудования и себестоимость одного токена приблизились к уровню систем на NVIDIA, но абсолютные расходы и методика сравнения не раскрыты. Код инфраструктуры и отдельная лицензия в материале не опубликованы.
Для бизнеса это сигнал, что автоматизация разработки может охватывать не только прикладной код, но и настройку вычислительных платформ. Подход потенциально выгоден облачным провайдерам и крупным разработчикам моделей, которым нужно быстрее переносить системы на новое оборудование. Риск — все показатели приведены самой Z.ai и относятся к внутреннему проекту; перед внедрением следует проверить результат на собственной нагрузке. Стоимость в рублях рассчитать нельзя: цена работы агента и затраты на кластер не раскрыты.
Z.ai также сообщает, что GLM-5.3-Flash ранее тестировалась под именем Ox-Alpha и за шесть дней обработала более 62 трлн токенов на OpenCode и OpenRouter. Эта цифра дана вендором, независимого подтверждения пока нет. Дальше важно отслеживать публикацию воспроизводимых тестов, стоимости эксплуатации и технических компонентов системы.
Что за модель: GLM-5.3-Flash
Z.ai выпустила GLM-5.3-Flash 2026-08-26 как первую модель семейства GLM-5 с изначальной поддержкой текста и изображений. Модель имеет 320 млрд параметров, из которых при работе задействуются 18 млрд, и поддерживает контекст до 1 048 576 токенов. Архитектура сочетает разреженное подключение параметров, разреженное и линейное внимание; веса опубликованы по лицензии MIT. По данным вендора, GLM-5.3-Flash превосходит GLM-5.2 в прикладных и тестовых задачах при цене примерно в десять раз ниже, однако независимых замеров пока нет.
Что это значит для бизнеса
Модель подходит компаниям, которым нужны анализ крупных репозиториев, автоматизация длительных инженерных задач и обработка изображений без передачи данных закрытому поставщику. Через OpenRouter работа стоит 0.075 USD за 1M входных и 0.25 USD за 1M выходных токенов. Главный риск при развертывании у себя — размер весов: несмотря на 18 млрд активных параметров, хранить и обслуживать нужно модель на 320 млрд параметров; до закупки оборудования следует проверить доступные форматы сжатия, скорость и качество на собственных задачах.
Хроника GLM-5.3-Flash
Цена API изменилась: $0.15/0.5 → $0.03/0.9 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.04/0.14 → $0.04/0.5 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.15/0.5 → $0.04/0.5 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.15/0.5 → $0.04/0.6 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.04/0.6 → $0.04/0.14 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.15/0.5 → $0.04/0.6 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.