Кибер-Миша
Релиз24 сен 2026

C5R запустила SciUniverse для проверки моделей в лаборатории

2026-09-24 компания C5R представила SciUniverse Level 1 — испытание моделей на выполнении научной работы в химии, биологии и материаловедении. Набор включает 92 задания в 17 категориях: модели управляют оборудованием, дают инструкции операторам, анализируют показания приборов и корректируют действия после сбоев. Часть задач выполняется с реальными материалами и установками Facility-0, часть — в программной среде.

По данным C5R, лучший результат показала Claude Fable 5.1: 45,3% успешных попыток при средней стоимости работы модели $40,61 на задание. GPT-6 Astra набрала 32,5% при $52,37, Claude Opus 5 — 30,5% при $46,31, Grok 4.6 — 26,2% при $13,41. Gemini 3.8 Flash получила 14,6% при $4,55, GPT-5.6 Sol — 9,4% при $16,53. Учитывалась только стоимость обращения к API; лабораторные материалы, оборудование и труд операторов в расчёт не вошли. Независимых замеров пока нет.

Для фармацевтических, химических и материаловедческих компаний SciUniverse даёт способ сравнивать модели не по ответам на вопросы, а по способности довести эксперимент до измеримого результата. При условном курсе 83 RUB за USD одна попытка стоит примерно от 380 до 4 350 RUB без расходов лаборатории. Главный риск — ограниченное число повторов в физических заданиях, из-за чего оценки пока нестабильны; перед выбором модели стоит провести собственные испытания на рабочих протоколах.

C5R планирует увеличить пропускную способность Facility-0 и число повторов в следующем выпуске. «Кибер-Радар» будет отслеживать расширение набора задач и изменение результатов моделей после независимой проверки.

Первоисточник ↗