llama.cpp v0.6.0 ускоряет работу Qwen3.8-Flash-Next и расширяет локальный запуск моделей
2026-10-05 проект ggml-org выпустил llama.cpp v0.6.0. Версия добавила MTP-декодирование для экспериментальной архитектуры Qwen4Exp, на которой построена Qwen3.8-Flash-Next: модель заранее предлагает несколько следующих токенов, а основной блок проверяет их за один проход. По данным разработчиков llama.cpp, это ускоряет формирование ответа примерно в 1,5 раза на DGX Spark; независимых сопоставимых замеров пока нет. Также появились поддержка GLM-5.3-Flash на 320B параметров и Clef для текста и изображений.
Релиз получил расширенный интерфейс обработки пакетов llama_batch_ext, поддержку смешанных токенов и векторных представлений, а также отдельный серверный метод /v1/systemone для decision-моделей. Веб-интерфейс переведён на новый механизм загрузки моделей из Hugging Face Hub с предварительной оценкой необходимой памяти. Для Apple Metal добавлены новые операции, ускоряющие отдельные вычисления до трёх раз по данным проекта, а Vulkan получил оптимизации для сжатого кэша. llama.cpp распространяется по лицензии MIT и доступен бесплатно для развёртывания у себя.
Для компаний релиз снижает технический барьер при запуске новых открытых моделей на собственном оборудовании и может сократить задержку ответов Qwen3.8-Flash-Next без перехода на внешний API. Стоимость лицензии составляет 0 рублей, но итоговый бюджет зависит от серверов, памяти, электроэнергии и сопровождения; универсальной оценки в рублях разработчики не приводят. Основной риск — заявленное ускорение зависит от модели и оборудования: перед рабочим внедрением следует проверить скорость, качество ответов и потребление памяти на типовых данных компании.
Далее важно отслеживать стабильность Qwen4Exp на разных видеокартах и появление независимых замеров MTP. Данных о гарантированной производительности и коммерческой поддержке для этого релиза пока нет.