Кибер-Миша
Релиз28 авг 2026

RealSWE: новый тест выявил разрыв между рейтингами моделей и реальной разработкой

2026-08-28 исследователи Sungkyunkwan University представили RealSWE — открытый тест и настраиваемую среду оценки моделей для программной разработки. Набор включает 381 семейство задач на основе SWE-bench Verified и SWE-bench Pro. В испытании семи моделей переход от подробных постановок к коротким пользовательским запросам снизил долю решённых задач в среднем на 6,4 процентного пункта, по данным авторов; независимых замеров пока нет.

RealSWE-bench формирует по одному реалистичному варианту каждой задачи, а RealSWE-framework позволяет менять состав информации и стиль запроса. Авторы изучили 718 запросов разработчиков: 88% содержали только описание проблемы либо минимум дополнительного контекста, тогда как среди исходных заданий SWE-bench таких было 7%. Код и материалы заявлены как открытые, но точные условия лицензии и стоимость запуска в первоисточнике не зафиксированы.

Для бизнеса вывод практический: результаты привычных тестов могут завышать качество работы модели с неполными заявками сотрудников. Добавление ожидаемого результата повышало успешность исправления ошибок на 8 процентных пунктов, а объяснение цели новой функции — до 7 пунктов, по данным авторов. Публичной цены у RealSWE нет; бюджет в рублях зависит от выбранной модели, числа повторов и вычислительной инфраструктуры, поэтому достоверно оценить его без сценария запуска нельзя. Риск — принять авторские результаты за универсальный рейтинг; перед закупкой стоит повторить тест на собственных репозиториях и типовых запросах.

Дальше важно проверить воспроизводимость результатов, условия лицензии и появление независимых прогонов. Также следует отслеживать, сохраняется ли изменение рейтинга моделей при использовании корпоративного кода и других средств автоматизации разработки.

Первоисточник ↗