Кибер-Миша
Релиз7 сен 2026

LayerStoRm запустил GLM-5.3-Flash с контекстом 1M на четырёх потребительских GPU

2026-09-07 опубликован LayerStoRm — экспериментальный движок для работы больших MoE-моделей на оборудовании с ограниченной видеопамятью. Разработчик продемонстрировал GLM-5.3-Flash в сборке UD-Q4_K_XL объёмом 186 GiB на двух RTX 5090 и двух RTX 5080 с суммарными 96 GB видеопамяти. Контекст достигает 1 048 576 токенов. По данным разработчика, скорость составила 24,5 токена/с при входе 8 000 токенов и 159 токенов/с при обработке входа длиной 27 000 токенов; независимых замеров пока нет.

LayerStoRm хранит набор экспертов модели в оперативной памяти и передаёт нужные части на GPU по PCIe во время работы. Для проверенной конфигурации потребовалось около 207,5 GB закреплённой оперативной памяти только под экспертов, а тестовый сервер имел 512 GB DDR5 и 64 GB HBM. Проект распространяется по лицензии MIT, поддерживает API, совместимый с OpenAI, но сейчас рассчитан только на NVIDIA RTX 50xx и один сервер. Разработчик прямо обозначает решение как исследовательское и не рекомендует его для эксплуатации в производственных системах.

Для компаний это возможность развернуть GLM-5.3-Flash у себя без серверных GPU, если уже есть рабочая станция с несколькими RTX 5090/5080 и большим объёмом RAM. Точная стоимость такой конфигурации в рублях не раскрыта и зависит от локальных цен на четыре GPU, серверную платформу и не менее 256–512 GB памяти, поэтому надёжную оценку пока дать нельзя. Основные риски — ограничение по оборудованию, невысокая параллельная нагрузка и передача данных через PCIe; перед пилотом следует проверить скорость на собственных запросах и заложить резерв памяти. Мы будем отслеживать независимые тесты, поддержку AMD, нескольких серверов и пакетной обработки.

Первоисточник ↗

Что за модель: GLM-5.3-Flash

Z.ai выпустила GLM-5.3-Flash 2026-08-26 как первую модель семейства GLM-5 с изначальной поддержкой текста и изображений. Модель имеет 320 млрд параметров, из которых при работе задействуются 18 млрд, и поддерживает контекст до 1 048 576 токенов. Архитектура сочетает разреженное подключение параметров, разреженное и линейное внимание; веса опубликованы по лицензии MIT. По данным вендора, GLM-5.3-Flash превосходит GLM-5.2 в прикладных и тестовых задачах при цене примерно в десять раз ниже, однако независимых замеров пока нет.

Разработчикzhipu
Дата выхода26 августа 2026
Контекст1M
ДоступОткрытые веса
ЛицензияMIT
Цена входа$0.07 · ≈ 6.8 ₽
Цена вывода$0.25 · ≈ 23 ₽
Полная карточка GLM-5.3-Flash: цена, характеристики, история версий

Что это значит для бизнеса

Модель подходит компаниям, которым нужны анализ крупных репозиториев, автоматизация длительных инженерных задач и обработка изображений без передачи данных закрытому поставщику. Через OpenRouter работа стоит 0.075 USD за 1M входных и 0.25 USD за 1M выходных токенов. Главный риск при развертывании у себя — размер весов: несмотря на 18 млрд активных параметров, хранить и обслуживать нужно модель на 320 млрд параметров; до закупки оборудования следует проверить доступные форматы сжатия, скорость и качество на собственных задачах.

Хроника GLM-5.3-Flash

27 авг 2026Апдейт

Zhipu выпустила открытые веса GLM-5.3-Flash

Zhipu выпустила GLM-5.3-Flash с 320 млрд параметров, из которых активны 18 млрд. Модель поддерживает изображения, программный код и контекст до 1 млн токенов. Веса опубликованы по лицензии MIT, а для развёртывания заявлена поддержка SGLang, vLLM и TokenSpeed. Результат около 206 токенов в секунду на DGX Station GB300 остаётся неподтверждённым пользовательским замером и в карточку не включён.

26 авг 2026Релиз

Z.ai выпустила открытую мультимодальную модель GLM-5.3-Flash

Z.ai представила GLM-5.3-Flash с 320 млрд параметров, из которых при работе задействуются 18 млрд. Модель принимает текст и изображения, ориентирована на программирование и длительные многоэтапные задачи. Веса опубликованы по лицензии MIT, поэтому модель можно развернуть у себя. Заявленные результаты тестов предоставлены вендором; независимых замеров пока нет.

26 авг 2026Апдейт

Z.ai выпустила открытые веса GLM-5.3-Flash

Z.ai опубликовала веса GLM-5.3-Flash на Hugging Face под лицензией MIT. Модель получила 320 млрд параметров, 18 млрд активных параметров, встроенную работу с изображениями и контекст до 1 млн токенов. Для развертывания у себя заявлена поддержка SGLang, vLLM и TokenSpeed.

26 авг 2026Апдейт

Z.ai выпустила GLM-5.3-Flash с открытыми весами

Z.ai открыла доступ к GLM-5.3-Flash и опубликовала веса модели под лицензией MIT. Модель содержит 320 млрд параметров, из которых при работе активируются 18 млрд, и принимает текст и изображения. По данным вендора, новая гибридная архитектура снижает вычислительные затраты по сравнению с GLM-5.3 и поддерживает контекст до 1 млн токенов. Независимых замеров производительности и требований к инфраструктуре пока нет.

26 авг 2026Апдейт

Z.ai выпустила GLM-5.3-Flash с открытыми весами

2026-08-26 Z.ai официально выпустила GLM-5.3-Flash и открыла веса модели под лицензией MIT. Модель получила 320 млрд параметров, из которых при работе задействуются 18 млрд, поддержку изображений и контекст до 1 млн токенов. Все опубликованные результаты тестов предоставлены Z.ai; независимых замеров пока нет.

26 авг 2026Апдейт

Zhipu выпустила GLM-5.3-Flash с открытыми весами

Zhipu официально выпустила GLM-5.3-Flash, ранее проходившую закрытое тестирование под именем Ox Alpha. Модель получила 320 млрд параметров при 18 млрд активных, мультимодальный ввод и контекст до 1 048 576 токенов. Веса доступны на Hugging Face по лицензии MIT, а для развертывания у себя заявлена поддержка SGLang, vLLM, TokenSpeed и KTransformers. Представленные результаты тестов получены или собраны вендором; независимых замеров пока нет.