Qwen3.8-Flash-Next получил компактную GSQ-RCO Coder-сборку на 58,4 ГБ
2026-09-29 лаборатория ISTA-DASLab опубликовала специализированную GGUF-сборку Qwen3.8-Flash-Next для программирования. У модели удалены 50% экспертов: в каждом из 48 слоёв осталось 256 из 512. Полный комплект занимает 58,4 ГБ против 354 ГБ у исходных весов BF16, при этом постоянно в памяти требуется держать 29,6 ГБ.
Оставшиеся веса представлены с точностью 3,5 бита, а заявленные 1,89 бита на параметр — расчётный показатель с учётом удалённых экспертов, а не фактическая точность каждого веса. Сборка сохраняет работу с изображениями, распространяется в формате GGUF под Apache 2.0 и запускается через llama.cpp. По данным авторов, результат составляет 75,60 на SWE-bench Verified и 86,28 на LiveCodeBench v6 против 82,80 и 87,43 у исходной версии; независимых замеров пока нет.
Для бизнеса выпуск снижает требования к оборудованию: основную часть модели можно разместить на одном ускорителе с 32 ГБ памяти, а второй файл объёмом 28,8 ГБ хранить на накопителе. Сами веса доступны без платы за токены, поэтому их цена составляет 0 USD за 1M токенов и 0 рублей; расходы определяются сервером, электроэнергией и сопровождением. Риск — ухудшение качества вне программирования и на длинных многошаговых задачах; перед внедрением нужно проверить сборку на собственных сценариях и сравнить её с полной Qwen3.8-Flash-Next.
Что за модель: Qwen3.8-Flash-Next
Alibaba Qwen выпустила Qwen3.8-Flash-Next 2026-08-24 как экспериментальную открытую модель с поддержкой текста, программного кода, изображений и видео. Модель содержит 125 млрд параметров и задействует 6 млрд при обработке запроса; отдельно заявлены 51 млрд параметров n-gram embeddings и 4 млрд параметров MTP. Базовый контекст составляет 262 144 токена, с возможностью расширения до 1 млн токенов. Архитектура объединяет Gated DeltaNet, Qwen Sparse Attention и 512 экспертов, из которых на каждом шаге работают 10 маршрутизируемых и один общий. Все опубликованные результаты тестов предоставлены вендором, независимых замеров пока нет.
Что это значит для бизнеса
Модель подходит компаниям, которым нужны обработка документов, программного кода и визуальных материалов с возможностью развернуть систему у себя. Основное преимущество — только 6 млрд активных параметров при общей емкости 125 млрд, что потенциально снижает вычислительные расходы по сравнению с полностью активными моделями сопоставимого размера. Риск — экспериментальный статус архитектуры и отсутствие независимых измерений скорости, качества и требований к оборудованию; перед внедрением следует провести проверку на собственных данных и рассчитать стоимость инфраструктуры. Цена официального API в USD за 1M токенов для этой версии не опубликована.
Хроника Qwen3.8-Flash-Next
Qwen3.8-Flash-Next вышла с открытыми весами
Qwen опубликовала веса Qwen3.8-Flash-Next на Hugging Face и ModelScope 2026-08-27. Это экспериментальная мультимодальная MoE-модель на 125 млрд параметров, из которых при работе задействуются 6 млрд; собственный контекст составляет 262 144 токена с заявленной возможностью расширения до 1 млн. По данным Qwen, модель набрала 62,5 на SWE-bench Pro и 58,7 на DeepSWE 1.1, однако независимых замеров пока нет. Веса распространяются по Qwen Community License 1.0.
Qwen3.8-Flash-Next вышла с открытыми весами и архитектурой Qwen4
Alibaba Qwen выпустила открытые веса Qwen3.8-Flash-Next 2026-08-26. Модель сочетает основную часть на 125B параметров и N-gram embeddings на 51B, при работе активируются 6B параметров на токен. Нативный контекст составляет 262 144 токена, расширение до 1M доступно через YaRN. Все показатели производительности опубликованы вендором, независимых замеров пока нет.
Qwen3.8-Flash-Next стала доступна с открытыми весами
Alibaba Qwen опубликовала веса Qwen3.8-Flash-Next на Hugging Face 2026-08-26. Репозиторий содержит модель объёмом 180B параметров и лицензию Qwen Community License 1.0. Модель работает с текстом, кодом и изображениями; заявлена поддержка Transformers, vLLM и SGLang. Это экспериментальная версия архитектуры, которую Qwen связывает с будущей линейкой Qwen4; независимых замеров скорости и качества пока нет.
Alibaba Qwen выпустила открытую модель Qwen3.8-Flash-Next
Alibaba Qwen опубликовала веса Qwen3.8-Flash-Next — экспериментальной модели с 125 млрд параметров, из которых 6 млрд задействуются при обработке запроса. Модель работает с текстом, программным кодом, изображениями и видео, а базовый контекст составляет 262 144 токена. По данным вендора, архитектура станет основой будущего семейства Qwen4; независимых замеров производительности пока нет.