Z.ai опубликовала открытые веса GLM-5.3-Flash
2026-08-25 Z.ai разместила веса GLM-5.3-Flash на Hugging Face, поэтому модель теперь можно развернуть в собственной инфраструктуре. В карточке указаны 320 млрд параметров, из которых при работе задействуются 18 млрд. GLM-5.3-Flash принимает текст и изображения, генерирует текст и программный код; для запуска заявлена поддержка SGLang, vLLM, TokenSpeed и KTransformers.
Веса распространяются по лицензии MIT. Модель построена по схеме MoE и сочетает разреженный и линейный механизмы внимания. По данным вендора, новый базовый вариант обучен на мультимодальном наборе объёмом 30 трлн токенов, превосходит GLM-5.2 в тестах и прикладных сценариях и обходится в десять раз дешевле при доступе через сервис Z.ai. Точные цены в USD за 1M токенов в карточке Hugging Face не приведены, поэтому подтвердить это сравнение пока нельзя; независимых замеров также нет.
Для бизнеса релиз интересен возможностью держать исходный код, документы и изображения внутри контролируемого контура. Это подходит крупным командам разработки, аналитическим подразделениям и компаниям с ограничениями на передачу данных внешним сервисам. Рассчитать стоимость работы в рублях по опубликованным данным нельзя: вендор не указал цену API, а расходы самостоятельного размещения зависят от оборудования и загрузки. Основной риск — модель содержит 320 млрд параметров, поэтому перед внедрением нужно провести испытание на своей инфраструктуре и сравнить совокупные расходы с облачным доступом.
Что за модель: GLM-5.3-Flash
Z.ai выпустила GLM-5.3-Flash 2026-08-26 как первую модель семейства GLM-5 с изначальной поддержкой текста и изображений. Модель имеет 320 млрд параметров, из которых при работе задействуются 18 млрд, и поддерживает контекст до 1 048 576 токенов. Архитектура сочетает разреженное подключение параметров, разреженное и линейное внимание; веса опубликованы по лицензии MIT. По данным вендора, GLM-5.3-Flash превосходит GLM-5.2 в прикладных и тестовых задачах при цене примерно в десять раз ниже, однако независимых замеров пока нет.
Что это значит для бизнеса
Модель подходит компаниям, которым нужны анализ крупных репозиториев, автоматизация длительных инженерных задач и обработка изображений без передачи данных закрытому поставщику. Через OpenRouter работа стоит 0.075 USD за 1M входных и 0.25 USD за 1M выходных токенов. Главный риск при развертывании у себя — размер весов: несмотря на 18 млрд активных параметров, хранить и обслуживать нужно модель на 320 млрд параметров; до закупки оборудования следует проверить доступные форматы сжатия, скорость и качество на собственных задачах.
Хроника GLM-5.3-Flash
Z.ai выпустила открытую мультимодальную модель GLM-5.3-Flash
Z.ai представила GLM-5.3-Flash с 320 млрд параметров, из которых при работе задействуются 18 млрд. Модель принимает текст и изображения, ориентирована на программирование и длительные многоэтапные задачи. Веса опубликованы по лицензии MIT, поэтому модель можно развернуть у себя. Заявленные результаты тестов предоставлены вендором; независимых замеров пока нет.
Z.ai открыла веса GLM-5.3-Flash на Hugging Face
Z.ai опубликовала веса GLM-5.3-Flash на Hugging Face 2026-08-25, переведя существующую модель в статус доступной для самостоятельного развёртывания. Карточка указывает 320 млрд параметров, 18 млрд активных параметров, мультимодальную работу и лицензию MIT. Поддерживаются SGLang, vLLM, TokenSpeed и KTransformers. Заявленные преимущества перед GLM-5.2 приведены самим вендором; независимых замеров пока нет.