Meta представила SWE-sweep — тест моделей на самостоятельный поиск ошибок
2026-10-01 исследователи Meta FAIR, Stanford University, Harvard University и University of Washington представили SWE-sweep — тест для оценки самостоятельного поиска и исправления ошибок в программном коде. В набор вошли 4 068 реальных ошибок из 100 репозиториев на 22 языках программирования. Модели получают весь проект без описания проблемы и должны найти дефекты, подготовить исправления и не нарушить существующую работу программы.
Код SWE-sweep опубликован по лицензии MIT, проверка исправлений проводится скрытыми тестами. Авторы оценили семь моделей в десяти конфигурациях: лучший результат показала GPT-5.6 Sol с повышенным уровнем рассуждений — 4,7% исправленных ошибок. Полный прогон по 100 проектам стоил около 7 230 USD, тогда как GPT-5.6 Luna получила 2,5% примерно за 224 USD. Это данные авторов исследования; независимых замеров пока нет.
Для бизнеса результат показывает, что модели пока нельзя без контроля назначать ответственными за профилактический аудит крупных кодовых баз. При курсе 83,2454 RUB за USD полный прогон GPT-5.6 Sol обходится примерно в 602 тыс. рублей, а GPT-5.6 Luna — в 18,6 тыс. рублей без учета инфраструктуры и проверки инженерами. SWE-sweep может помочь сравнить системы для контроля качества и планировать пилоты, но риск низкой полноты поиска остается высоким: модель-лидер пропустила более 95% известных ошибок, поэтому результаты следует перепроверять обычными тестами, анализаторами кода и ручным аудитом.