Z.ai выпустила открытые веса GLM-5.3-Flash в формате BF16
2026-08-25 Z.ai опубликовала на Hugging Face контрольную точку GLM-5.3-Flash-BF16. Это открытые веса модели GLM-5.3-Flash, а не отдельная новая модель. По данным вендора, она содержит 320 млрд параметров, при работе задействует 18 млрд и поддерживает текст, программный код и изображения.
Файлы распространяются по лицензии MIT и позволяют развернуть модель у себя. Z.ai описывает архитектуру как сочетание разреженной маршрутизации и механизмов линейного внимания; в каталоге модель относится к семейству glm5_next. Точные пределы контекста и ответа для этой контрольной точки не указаны. Опубликованный вариант BF16 требует значительного объёма памяти, однако подтверждённой конфигурации оборудования и независимых замеров скорости пока нет.
Для бизнеса выпуск снижает зависимость от внешнего API: модель можно использовать в закрытом контуре для анализа кода, документов и изображений. Риск — высокая стоимость собственной инфраструктуры и отсутствие проверенных данных о производительности; перед внедрением стоит провести тест на целевых серверах и собственных задачах. Пересчитать расходы в рубли пока нельзя: Z.ai не раскрыла стоимость рекомендуемой конфигурации, а итоговая сумма зависит от числа ускорителей, аренды и загрузки.
Мы будем отслеживать публикацию требований к оборудованию, точных лимитов контекста и независимых сравнений с GLM-5.2 и закрытыми моделями. До появления таких данных заявления Z.ai о качестве и экономичности следует считать оценкой вендора.
Что за модель: GLM-5.3-Flash
Z.ai выпустила GLM-5.3-Flash 2026-08-26 как первую модель семейства GLM-5 с изначальной поддержкой текста и изображений. Модель имеет 320 млрд параметров, из которых при работе задействуются 18 млрд, и поддерживает контекст до 1 048 576 токенов. Архитектура сочетает разреженное подключение параметров, разреженное и линейное внимание; веса опубликованы по лицензии MIT. По данным вендора, GLM-5.3-Flash превосходит GLM-5.2 в прикладных и тестовых задачах при цене примерно в десять раз ниже, однако независимых замеров пока нет.
Что это значит для бизнеса
Модель подходит компаниям, которым нужны анализ крупных репозиториев, автоматизация длительных инженерных задач и обработка изображений без передачи данных закрытому поставщику. Через OpenRouter работа стоит 0.075 USD за 1M входных и 0.25 USD за 1M выходных токенов. Главный риск при развертывании у себя — размер весов: несмотря на 18 млрд активных параметров, хранить и обслуживать нужно модель на 320 млрд параметров; до закупки оборудования следует проверить доступные форматы сжатия, скорость и качество на собственных задачах.
Хроника GLM-5.3-Flash
Цена API изменилась: $0.03/0.9 → $0.15/0.5 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.15/0.5 → $0.04/0.5 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.15/0.5 → $0.04/0.5 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.03/0.9 → $0.04/0.5 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.04/0.5 → $0.02/0.5 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.15/0.5 → $0.03/0.9 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.