Кибер-Миша
Апдейт17 авг 2026· 🇨🇳 Ant Group (inclusionAI)

llama.cpp добавил поддержку Ling-3.0-flash

В основную ветку llama.cpp добавлена поддержка архитектуры BailingMoE3, что позволяет развернуть Ling-3.0-flash у себя в формате GGUF. Реализация также поддерживает встроенный механизм ускорения подготовки ответа MTP. Риск — в обсуждении изменений отмечались отдельные сбои и ограничения на некоторых конфигурациях Vulkan и ROCm; перед рабочим внедрением следует проверить модель на целевом оборудовании и закрепить проверенную сборку llama.cpp. Независимых сопоставимых замеров производительности пока нет.

Первоисточник ↗

Что за модель: Ling-3.0-flash

Модель Ant Group (inclusionAI) со ставкой на эффективность: 124B параметров, активных всего ~5.1B — активация 1/64 (512 экспертов плюс 1 общий, 8 на токен). Внимание гибридно-линейное: 35 слоёв KDA на 7 слоёв Gated MLA. Контекст 256K (обучение по расписанию 8K → 32K → 256K); заявлена скорость до 1,000 токенов/с. По данным вендора, обгоняет собственный флагман Ling-2.6-1T в 11 тестах; в карточке: SWE-bench Pro 56.6, AIME 2026 93.2. Анонс 23 июля 2026; на старте только API, веса выложены на Hugging Face под MIT через несколько дней.

РазработчикAnt Group (inclusionAI)
Дата выхода23 июля 2026
Контекст262K
ДоступOpen source
ЛицензияMIT
Полная карточка Ling-3.0-flash: цена, характеристики, история версий

Что это значит для бизнеса

Обычному бизнесу пока не нужна — это модель для IT-команд, которые разворачивают ИИ на собственных серверах и умеют это делать. Постоянного облачного тарифа у неё нет: бесплатный период на OpenRouter закончился в начале августа, так что «подключиться и платить по счётчику» сейчас не выйдет. Для тех, кто держит модели у себя, предложение интересное: она быстрая и очень экономная в работе, а лицензия MIT — максимально свободная, встраивать в коммерческие продукты можно без оглядки. Заявленные результаты приличные — уровень добротной рабочей модели для задач с кодом и документами, — но все цифры от самого производителя (Ant Group), независимых проверок нет. Если выбираете открытую модель на своё железо, сравните с Hunyuan Hy3 (сильнее, но требует больше железа) и gpt-oss-120b (известнее и проще в поддержке). А если своей IT-команды нет — берите облачные модели с понятным прайсом вроде Grok 4.3.

Хроника Ling-3.0-flash

11 авг 2026Апдейт

inclusionAI опубликовала промежуточные базовые веса Ling-3.0-flash

inclusionAI открыла под лицензией MIT промежуточную версию базовых весов Ling-3.0-flash после дополнительного этапа обучения, но до финальной подготовки модели к прикладным задачам. Это не новая модель, а материал для продолжения обучения и исследований; риск — версия не предназначена для непосредственного использования в бизнес-процессах, поэтому для готовых решений следует выбирать основную Ling-3.0-flash.

23 июл 2026Релиз

Релиз Ling-3.0-flash

Анонс и запуск API; открытые веса появились на Hugging Face под MIT через несколько дней после анонса.