Microsoft выпустила ThinkingBox для проверки надежности AI-агентов
2026-10-03 Microsoft и Hugging Face открыли ThinkingBox — среду для проверки AI-агентов по фактическим изменениям в корпоративных системах. Набор ThinkingBox-Bench включает 507 синтетических сценариев из розницы, страхования, туризма, цифрового банкинга и консалтинга. Каждый сценарий выполнялся 20 раз, а результат оценивался по конечному состоянию записей и побочным действиям, а не по ответу модели. По данным авторов, из 79 853 неудачных попыток 67,24% завершились без видимой ошибки, хотя проверка обнаружила неверные значения или пропущенные действия.
Код ThinkingBox опубликован по лицензии MIT, данные — по CDLA-Permissive-2.0, среда OpenEnv — по BSD-3-Clause. Для запуска нужны Linux или WSL, Python 3.11+, Docker, собственные точки доступа к моделям и отдельный сервис Typesense. В оценке участвовали 18 моделей; лучшие результаты одного запуска, по данным авторов, показали Claude Opus 5.5 — 67,16%, Claude Opus 5 — 66,50% и GPT-5.4 — 65,36%. Независимых замеров пока нет.
Для бизнеса ThinkingBox полезен при выборе модели для процессов, которые меняют заказы, заявки, выплаты или клиентские записи. Главный риск — считать корректный текстовый ответ доказательством выполненной операции; разработчикам стоит проверять конечное состояние системы, повторять тесты и оставлять подтверждение человека для необратимых действий. Сам набор доступен бесплатно, но расходы на вычисления и API оплачиваются отдельно; достоверной оценки в рублях нет, поскольку она зависит от выбранных моделей, числа повторов и курса валют. Мы будем отслеживать независимое воспроизведение результатов и появление тестов на реальных корпоративных сценариях.