DFlash 2 ускоряет работу Qwen3.8 27B с помощью отдельной модели-черновика
2026-08-20 Inco AI опубликовала DFlash 2 для Qwen3.8 27B — вспомогательную модель примерно на 2B параметров, которая заранее формирует блок вариантов ответа, а основная модель проверяет их. Это не самостоятельная LLM и не обновление Qwen3.8 27B, поэтому релиз учитывается как новость об инструменте ускорения. Заявленные сообществом результаты до 2,26–8 раз первоисточником не подтверждены и в оценку релиза не включены.
Модель распространяется по лицензии Apache-2.0 и доступна в исходном формате и GGUF: файлы занимают около 1,1 GB в 4-битном варианте, 2,0 GB в 8-битном и 3,8 GB в BF16. Поддержка llama.cpp на момент публикации находилась в отдельной ветке PR #27342; также заявлена работа через другие серверные инструменты. По данным вендора, средняя длина принятого блока на восьми заданиях GSM8K составила 5,28 для BF16, 5,13 для Q8_0 и 5,39 для Q4_K_M; независимых сопоставимых замеров пока нет.
Для бизнеса DFlash 2 может снизить задержку локальных помощников по программированию и повысить загрузку уже купленных GPU без перехода на другую основную модель. Плата за API не заявлена, поэтому перевести стоимость работы в рубли нельзя: расходы определяются сервером, электроэнергией и сопровождением. Главный риск — ранняя поддержка и зависимость от конкретной сборки llama.cpp; перед внедрением стоит проверить скорость, стабильность и потребление памяти на собственных запросах и оборудовании.
Дальше важно отслеживать включение поддержки DFlash 2 в стабильный выпуск llama.cpp, появление результатов на более широких наборах задач и поведение при нескольких одновременных запросах. Без таких данных перенос результатов одиночных испытаний на производственную нагрузку преждевременен.
Что за модель: Qwen3.8 27B
Компактная модель новой линейки Qwen3.8 и преемница Qwen3.6-27B: 27B параметров, контекст 256K токенов. Веса опубликованы на Hugging Face под свободной лицензией Apache-2.0 (есть и сжатая FP8-версия), в хостинговых каталогах модель появилась 14 августа 2026 по цене $0.45/$3.20 за миллион токенов. Официального техотчёта и таблицы замеров на момент выхода нет — независимые проверки только начинаются. Судя по загрузкам на Hugging Face (100K+ за первые дни), сообщество приняло релиз активно.
Что это значит для бизнеса
Главный кандидат для компаний, которые хотят развернуть модель у себя и не зависеть от чужих серверов: свободная лицензия Apache-2.0 разрешает любое коммерческое использование без юридических рисков, а размер позволяет работать на одной серверной видеокарте. Подойдёт для внутренних ботов, обработки документов и типовых задач, где данные нельзя отдавать наружу. Если развёртывание у себя не принципиально — через API DeepSeek V4-Flash даёт больше возможностей дешевле ($0.14/$0.28 против $0.45/$3.20). Замеров качества пока нет, поэтому перед боевым запуском прогоните на своих задачах. Для старта на собственном железе сейчас это самый безопасный выбор в базе.
Хроника Qwen3.8 27B
Цена API изменилась: $0.02/4.4 → $0.02/4.35 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.02/4.35 → $0.02/2.99 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.42/3.0 → $0.06/4.4 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.06/4.4 → $0.05/4.4 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.05/4.4 → $0.05/4.4 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.
Цена API изменилась: $0.21/2.55 → $0.05/4.4 за 1M токенов
Изменение зафиксировано по каталогу агрегатора OpenRouter.