llama.cpp добавил поддержку Decision Models
2026-10-02 проект llama.cpp добавил поддержку Decision Models через новый интерфейс /v1/systemone. Такие модели получают текст, JSON или изображение и оценивают заранее заданные варианты ответа вместо генерации текста. На старте заявлена работа с пятью моделями: Julia-1 на 144M параметров, Laya на 421M, Kev-4B и lev на 4B, а также OpenJev на 27B параметров.
Интерфейс совместим с форматом System One от TypeSafe и поддерживает выбор варианта, оценку по шкале и ответ «да/нет» с вероятностями. Модели доступны в формате GGUF; Julia-1, Laya, Kev-4B и lev распространяются по Apache 2.0, OpenJev — по CC BY-NC 4.0 и поэтому не подходит для коммерческого применения без отдельного разрешения. По данным разработчиков, один ответ занимает от 3 до 43 мс на NVIDIA RTX PRO 6000 в зависимости от модели; независимых замеров пока нет.
Для бизнеса это способ развернуть у себя маршрутизацию обращений, проверку действий программных помощников и модерацию без оплаты за каждый запрос внешнему API. Само ПО и открытые модели не имеют цены за 1M токенов, но потребуют собственных вычислительных ресурсов; точную стоимость в рублях без данных о нагрузке и оборудовании оценить нельзя. Основной риск — вероятностные ошибки при автоматическом принятии решений, поэтому порог уверенности следует проверять на данных компании, а спорные случаи передавать сотруднику.
Разработчики намерены расширять список совместимых моделей; следующей заявлена Cloudflare Clef. Будем отслеживать независимые сравнения качества, требования к оборудованию и появление моделей с лицензиями, разрешающими коммерческое использование.