Nonobench v1.2: GPT-6 Astra решил 30 из 30 задач, DeepSeek V4 Pro набрал 83,3%
2026-09-26 независимый проект Nonobench обновил тест логического мышления моделей до версии v1.2. В основной выборке сравниваются 43 модели на 30 японских кроссвордах размером до 15×15. GPT-6 Astra при уровне рассуждений xhigh первым получил 100% и решил 30 из 30 задач. DeepSeek V4 Pro с результатом 83,3% разделил позиции с Gemini 3.8 Flash и Grok 4.7.
В v1.2 уровень рассуждений фиксируется отдельно для каждого запуска, а запросы и ответы доступны для проверки. Добавлен режим Hard с сетками 20×20: в опубликованной таблице протестированы 14 моделей и выполнены 14 из 139 заданий, то есть 10,1%. DeepSeek V4 Pro, DeepSeek V4.1 Flash и другие модели с открытыми весами в этом режиме получили 0%; лучший результат показал Claude Opus 5.5 — 80%. Полный основной прогон DeepSeek V4 Pro стоил $2,74, GPT-6 Astra — $10,82, по данным авторов теста.
Для бизнеса результаты полезны как дополнительная проверка моделей для планирования, работы с таблицами и задач, где ошибка на одном шаге портит итог. Прогон DeepSeek V4 Pro обошёлся примерно в 260 рублей, а GPT-6 Astra — примерно в 1 030 рублей при условном курсе 95 рублей за USD. Риск — небольшая выборка и узкий формат головоломок: рейтинг нельзя напрямую переносить на документы, аналитику или программирование, поэтому перед закупкой доступа модели нужно повторить сравнение на собственных сценариях.
Nonobench продолжает добавлять модели и уровни усилия. Будем отслеживать, смогут ли модели с открытыми весами решить хотя бы одну задачу 20×20 и сохранятся ли позиции лидеров после расширения выборки.