Z.ai выпустила GLM-5.3-Flash с открытыми весами и контекстом 1 млн токенов
Z.ai 2026-08-26 выпустила GLM-5.3-Flash и опубликовала её веса на Hugging Face. Это первая модель серии GLM-5 со встроенной обработкой изображений: она рассчитана на текст, программный код и визуальные материалы. В конфигурации заявлены 320 млрд параметров, из которых при работе используются 18 млрд, 45 слоёв и контекст до 1 млн токенов.
GLM-5.3-Flash распространяется под лицензией MIT и может быть развёрнута у себя через SGLang, vLLM или TokenSpeed. Архитектура сочетает разреженное и линейное внимание; по данным Z.ai, это сокращает вычислительную нагрузку внимания в 3 раза, а объём оперативной памяти для длинного контекста — в 4,4 раза относительно GLM-5.3. В тесте DeepSWE v1.1 модель набрала 63,4 против 46,2 у GLM-5.2, а в AutomationBench — 48,8 против 26,2; независимых замеров пока нет. Тарифы API в USD за 1M токенов на момент публикации не раскрыты.
Для бизнеса модель интересна как основа внутренних помощников по разработке, анализа документов и интерфейсов, особенно когда данные нельзя передавать внешнему поставщику. Лицензия MIT упрощает коммерческое использование, но 320 млрд параметров делают самостоятельное размещение капиталоёмким: без конфигурации оборудования и тарифов облачных площадок корректно оценить стоимость в рублях пока нельзя. Основной риск — зависимость от заявленных вендором результатов; перед внедрением нужны собственные проверки качества, скорости и затрат.
Z.ai сообщила, что GLM-5.3-Flash уже доступна пользователям GLM Coding Plan и ранее проходила закрытое тестирование под именем ox-alpha. Дальше важно отслеживать официальную цену API, поддержку дополнительных средств запуска и независимые сравнения на русскоязычных корпоративных задачах.
Что за модель: GLM-5.3-Flash
Z.ai выпустила GLM-5.3-Flash 2026-08-26 как первую модель семейства GLM-5 с изначальной поддержкой текста и изображений. Модель имеет 320 млрд параметров, из которых при работе задействуются 18 млрд, и поддерживает контекст до 1 048 576 токенов. Архитектура сочетает разреженное подключение параметров, разреженное и линейное внимание; веса опубликованы по лицензии MIT. По данным вендора, GLM-5.3-Flash превосходит GLM-5.2 в прикладных и тестовых задачах при цене примерно в десять раз ниже, однако независимых замеров пока нет.
Что это значит для бизнеса
Модель подходит компаниям, которым нужны анализ крупных репозиториев, автоматизация длительных инженерных задач и обработка изображений без передачи данных закрытому поставщику. Через OpenRouter работа стоит 0.075 USD за 1M входных и 0.25 USD за 1M выходных токенов. Главный риск при развертывании у себя — размер весов: несмотря на 18 млрд активных параметров, хранить и обслуживать нужно модель на 320 млрд параметров; до закупки оборудования следует проверить доступные форматы сжатия, скорость и качество на собственных задачах.
Хроника GLM-5.3-Flash
Zhipu выпустила открытые веса GLM-5.3-Flash
Zhipu выпустила GLM-5.3-Flash с 320 млрд параметров, из которых активны 18 млрд. Модель поддерживает изображения, программный код и контекст до 1 млн токенов. Веса опубликованы по лицензии MIT, а для развёртывания заявлена поддержка SGLang, vLLM и TokenSpeed. Результат около 206 токенов в секунду на DGX Station GB300 остаётся неподтверждённым пользовательским замером и в карточку не включён.
Z.ai выпустила открытую мультимодальную модель GLM-5.3-Flash
Z.ai представила GLM-5.3-Flash с 320 млрд параметров, из которых при работе задействуются 18 млрд. Модель принимает текст и изображения, ориентирована на программирование и длительные многоэтапные задачи. Веса опубликованы по лицензии MIT, поэтому модель можно развернуть у себя. Заявленные результаты тестов предоставлены вендором; независимых замеров пока нет.
Z.ai выпустила открытые веса GLM-5.3-Flash
Z.ai опубликовала веса GLM-5.3-Flash на Hugging Face под лицензией MIT. Модель получила 320 млрд параметров, 18 млрд активных параметров, встроенную работу с изображениями и контекст до 1 млн токенов. Для развертывания у себя заявлена поддержка SGLang, vLLM и TokenSpeed.
Z.ai выпустила GLM-5.3-Flash с открытыми весами
Z.ai открыла доступ к GLM-5.3-Flash и опубликовала веса модели под лицензией MIT. Модель содержит 320 млрд параметров, из которых при работе активируются 18 млрд, и принимает текст и изображения. По данным вендора, новая гибридная архитектура снижает вычислительные затраты по сравнению с GLM-5.3 и поддерживает контекст до 1 млн токенов. Независимых замеров производительности и требований к инфраструктуре пока нет.
Z.ai выпустила GLM-5.3-Flash с открытыми весами
2026-08-26 Z.ai официально выпустила GLM-5.3-Flash и открыла веса модели под лицензией MIT. Модель получила 320 млрд параметров, из которых при работе задействуются 18 млрд, поддержку изображений и контекст до 1 млн токенов. Все опубликованные результаты тестов предоставлены Z.ai; независимых замеров пока нет.
Zhipu выпустила GLM-5.3-Flash с открытыми весами
Zhipu официально выпустила GLM-5.3-Flash, ранее проходившую закрытое тестирование под именем Ox Alpha. Модель получила 320 млрд параметров при 18 млрд активных, мультимодальный ввод и контекст до 1 048 576 токенов. Веса доступны на Hugging Face по лицензии MIT, а для развертывания у себя заявлена поддержка SGLang, vLLM, TokenSpeed и KTransformers. Представленные результаты тестов получены или собраны вендором; независимых замеров пока нет.