Grok 4.6 проверили на задачах биобезопасности
2026-09-01 xAI сообщила о публикации внешней оценки Grok 4.6 на наборах BioSecBench от LatchBio. Проверка охватывала распознавание скрытых биологических угроз, отказ от опасных запросов и выполнение обычных исследовательских задач. В BioSecBench-Refusal модель получила средний результат 62,1%: отказалась от 59,2% опасных заданий и выполнила 64,8% безопасных. По данным LatchBio, Grok 4.6 стала единственной протестированной системой, превысившей 50% по обоим показателям.
В BioSecBench-Surveillance, где оценивается работа с данными геномного мониторинга патогенов, средний результат Grok 4.6 составил 53,5%. Модель уступила Opus 5, но опередила GPT-5.6 Sol. Набор BioSecBench-Refusal включает 46 заданий с замаскированными рисками; модели проверяются в разных программных средах и на максимальных доступных уровнях глубины обработки. Это отдельное исследование LatchBio, однако широкого набора независимых повторных замеров пока нет.
Для фармацевтических компаний, лабораторий и служб эпидемиологического мониторинга результаты показывают потенциальную пригодность Grok 4.6 для первичного анализа материалов без чрезмерной блокировки безопасной работы. Риск состоит в том, что средняя успешность около 50–65% недостаточна для автономных решений: ответы следует проверять специалистами, а доступ к опасным данным — ограничивать. Новых тарифов xAI не объявила, поэтому стоимость такого применения в USD за 1M токенов и примерный бюджет в рублях по этой публикации рассчитать нельзя.
xAI планирует расширять проверки перед выпуском моделей, привлекать сторонних оценщиков и усиливать контроль уже работающих систем. Для бизнеса значимыми следующими сигналами станут повторные независимые тесты, результаты на закрытых корпоративных данных и сведения о стоимости защищённого внедрения.
Что за модель: Grok 4.6
Обновление флагмана SpaceXAI через месяц с небольшим после Grok 4.5: в API-каталогах модель появилась 12 августа 2026 по цене $2/$6 за миллион токенов с контекстом 500K. Линейка продолжает курс на программирование и агентские задачи, заданный совместной тренировкой с Cursor; сообщество активно обсуждает первые замеры, но официальной таблицы и независимых проверок на момент выхода мало. Цена та же, что у 4.5 в базовом тарифе.
Что это значит для бизнеса
Кандидат для команд разработки, которым важна скорость и цена: $2/$6 — заметно дешевле Claude Opus 5 ($5/$25), а по ранним отзывам модель уверенно держится в задачах кода и автоматизации. Для нетехнического бизнеса преимущество не так очевидно: в документах и аналитике конкуренты с миллионным контекстом (у Grok — 500K) выглядят практичнее. Учтите фактор возраста: модели меньше недели, реальное качество на ваших задачах проверяйте сами, а не по обещаниям. Доступ из РФ — через агрегаторы. Если вы уже на Grok 4.5 — апгрейд напрашивается: цена не изменилась.
Хроника Grok 4.6
Вышел Grok 4.6
Обновление флагмана через месяц после 4.5: та же цена $2/$6, контекст 500K, фокус на код и агентские задачи.