Кибер-Миша
Релиз28 авг 2026

Terminal-Bench 4.0 обновил оценку моделей и программных агентов

2026-08-28 команда Terminal-Bench выпустила Terminal-Bench 4.0 — новую несовместимую версию набора заданий и рейтинга для оценки программных агентов. Разработчики откалибровали лимиты времени, процессора и памяти, исправили 19 заданий и исключили ещё 8: два из-за насыщения результатами, два из-за отказов моделей, два из-за публикации решений и два из-за проблем с качеством или совместимостью. Единый лимит выполнения теперь составляет 8 часов. Утверждение о равенстве результатов GLM-5.3 и Fable 5 в официальном анонсе не приведено, поэтому фиксировать его как факт нельзя.

Terminal-Bench 4.0 построен на открытом фреймворке Harbor и доступен через Harbor Hub. В отличие от версии 3.0, обновление должно сократить число технических сбоев и тайм-аутов, однако изменение среды и состава заданий требует повторного запуска всех испытаний: старые показатели напрямую переносить нельзя. Команда также сообщила, что Sonnet 5 израсходовал 21,6 млрд токенов в рейтинговом прогоне против 6,5 млрд у Opus 5; это данные организаторов, независимых замеров пока нет. Отдельной цены у набора заданий нет, лицензия в анонсе не указана.

Для бизнеса версия полезна при выборе модели и программного агента для длительных задач в терминале: исправленные задания снижают риск принять сбой инфраструктуры за слабость модели. Главный риск — высокая стоимость полного испытания: она зависит от тарифов API и вычислительной среды, поэтому достоверной суммы в USD или рублях организаторы не назвали. Практический подход — сначала проверить несколько собственных критичных сценариев, а полный прогон использовать только для финального сравнения поставщиков.

Далее команда планирует Terminal-Bench 4.1 с улучшенными средствами проверки и Terminal-Bench 5.0 с новыми заданиями. Мы будем отслеживать подтверждённые результаты GLM-5.3, Fable 5 и других моделей на одинаковой конфигурации агента, включая доверительные интервалы, расход токенов и стоимость.

Первоисточник ↗