llama.cpp ускоряет работу Qwen3.8 27B с адаптивным подбором черновых токенов
2026-08-25 разработчик Laurent Zuijdwijk выпустил сборку b10641 форка llama.cpp с адаптивным подбором числа черновых токенов для MTP и DFlash2. Механизм меняет глубину предварительной генерации в заданных пределах в зависимости от характера ответа. На AMD Strix Halo с Radeon 8060S модель Qwen3.8 27B показала 65,6 токена в секунду против 13,9 без ускорения — это 4,7 раза быстрее по данным автора форка; независимых замеров пока нет.
Готовая сборка предназначена для Ubuntu x86-64, Vulkan 1.3 и драйвера Mesa RADV 26.0.8. Функция включается параметром --spec-draft-adaptive и работает с MTP и DFlash2. Это не обновление самой Qwen3.8 27B и не часть основной ветки llama.cpp, а отдельный форк с изменённым Vulkan-модулем. Исходный проект распространяется по лицензии MIT, отдельная плата за использование сборки не заявлена.
Решение интересно компаниям, которые хотят развернуть Qwen3.8 27B у себя на недорогих системах с общей памятью и сократить задержку при создании кода или структурированных данных. Лицензионные расходы составляют около 0 руб., но сохраняются затраты на оборудование, электроэнергию, тестирование и сопровождение отдельной ветки. Основной риск — результаты получены на одной конфигурации и могут не повториться на другом оборудовании; перед внедрением стоит проверить скорость, стабильность и качество ответов на собственных задачах.
Автор сообщает о возможной проблеме при размере рабочего контекста от 65 536 токенов и параметре ubatch 2048: вычислительный модуль GPU может перестать отвечать. Для длинных документов рекомендовано уменьшить значение до 512. Мы будем отслеживать независимые измерения и возможный перенос адаптивного режима в основную ветку llama.cpp.
Что за модель: Qwen3.8 27B
Компактная модель новой линейки Qwen3.8 и преемница Qwen3.6-27B: 27B параметров, контекст 256K токенов. Веса опубликованы на Hugging Face под свободной лицензией Apache-2.0 (есть и сжатая FP8-версия), в хостинговых каталогах модель появилась 14 августа 2026 по цене $0.45/$3.20 за миллион токенов. Официального техотчёта и таблицы замеров на момент выхода нет — независимые проверки только начинаются. Судя по загрузкам на Hugging Face (100K+ за первые дни), сообщество приняло релиз активно.
Что это значит для бизнеса
Главный кандидат для компаний, которые хотят развернуть модель у себя и не зависеть от чужих серверов: свободная лицензия Apache-2.0 разрешает любое коммерческое использование без юридических рисков, а размер позволяет работать на одной серверной видеокарте. Подойдёт для внутренних ботов, обработки документов и типовых задач, где данные нельзя отдавать наружу. Если развёртывание у себя не принципиально — через API DeepSeek V4-Flash даёт больше возможностей дешевле ($0.14/$0.28 против $0.45/$3.20). Замеров качества пока нет, поэтому перед боевым запуском прогоните на своих задачах. Для старта на собственном железе сейчас это самый безопасный выбор в базе.
Хроника Qwen3.8 27B
Вышла Qwen3.8 27B — компактная открытая модель линейки 3.8
Веса под Apache-2.0 на Hugging Face, в API-каталогах — $0.45/$3.20 за миллион токенов, контекст 256K.