Кибер-Миша
Релиз20 авг 2026

DFlash 2 ускоряет работу Qwen3.8 27B с помощью отдельной модели-черновика

2026-08-20 Inco AI опубликовала DFlash 2 для Qwen3.8 27B — вспомогательную модель примерно на 2B параметров, которая заранее формирует блок вариантов ответа, а основная модель проверяет их. Это не самостоятельная LLM и не обновление Qwen3.8 27B, поэтому релиз учитывается как новость об инструменте ускорения. Заявленные сообществом результаты до 2,26–8 раз первоисточником не подтверждены и в оценку релиза не включены.

Модель распространяется по лицензии Apache-2.0 и доступна в исходном формате и GGUF: файлы занимают около 1,1 GB в 4-битном варианте, 2,0 GB в 8-битном и 3,8 GB в BF16. Поддержка llama.cpp на момент публикации находилась в отдельной ветке PR #27342; также заявлена работа через другие серверные инструменты. По данным вендора, средняя длина принятого блока на восьми заданиях GSM8K составила 5,28 для BF16, 5,13 для Q8_0 и 5,39 для Q4_K_M; независимых сопоставимых замеров пока нет.

Для бизнеса DFlash 2 может снизить задержку локальных помощников по программированию и повысить загрузку уже купленных GPU без перехода на другую основную модель. Плата за API не заявлена, поэтому перевести стоимость работы в рубли нельзя: расходы определяются сервером, электроэнергией и сопровождением. Главный риск — ранняя поддержка и зависимость от конкретной сборки llama.cpp; перед внедрением стоит проверить скорость, стабильность и потребление памяти на собственных запросах и оборудовании.

Дальше важно отслеживать включение поддержки DFlash 2 в стабильный выпуск llama.cpp, появление результатов на более широких наборах задач и поведение при нескольких одновременных запросах. Без таких данных перенос результатов одиночных испытаний на производственную нагрузку преждевременен.

Первоисточник ↗

Что за модель: Qwen3.8 27B

Компактная модель новой линейки Qwen3.8 и преемница Qwen3.6-27B: 27B параметров, контекст 256K токенов. Веса опубликованы на Hugging Face под свободной лицензией Apache-2.0 (есть и сжатая FP8-версия), в хостинговых каталогах модель появилась 14 августа 2026 по цене $0.45/$3.20 за миллион токенов. Официального техотчёта и таблицы замеров на момент выхода нет — независимые проверки только начинаются. Судя по загрузкам на Hugging Face (100K+ за первые дни), сообщество приняло релиз активно.

Разработчикalibaba-qwen
Дата выхода14 августа 2026
Контекст262K
ДоступOpen source
ЛицензияApache-2.0
Цена входа$0.45 · ≈ 41 ₽
Цена вывода$3.2 · ≈ 288 ₽
Полная карточка Qwen3.8 27B: цена, характеристики, история версий

Что это значит для бизнеса

Главный кандидат для компаний, которые хотят развернуть модель у себя и не зависеть от чужих серверов: свободная лицензия Apache-2.0 разрешает любое коммерческое использование без юридических рисков, а размер позволяет работать на одной серверной видеокарте. Подойдёт для внутренних ботов, обработки документов и типовых задач, где данные нельзя отдавать наружу. Если развёртывание у себя не принципиально — через API DeepSeek V4-Flash даёт больше возможностей дешевле ($0.14/$0.28 против $0.45/$3.20). Замеров качества пока нет, поэтому перед боевым запуском прогоните на своих задачах. Для старта на собственном железе сейчас это самый безопасный выбор в базе.

Хроника Qwen3.8 27B

14 авг 2026Релиз

Вышла Qwen3.8 27B — компактная открытая модель линейки 3.8

Веса под Apache-2.0 на Hugging Face, в API-каталогах — $0.45/$3.20 за миллион токенов, контекст 256K.