Проблема «научного вкуса»
Научные данные редко приходят с инструкциями. Исследователи постоянно сталкиваются с неоднозначностью: нужно отличить биологический сигнал от шума, решить, поддерживает ли данные поставленный вопрос, и как изменить план анализа на основе промежуточных результатов. OpenAI отмечает, что современные ИИ-агенты хорошо справляются с выполнением готовых рабочих процессов, но терпят неудачу на этапе принятия решений.
GeneBench-Pro создан для измерения именно этих «высших» когнитивных навыков, которые авторы называют «научным вкусом» (research taste). Это способность модели исследовать данные, корректировать гипотезы и понимать, когда результат готов к принятию решений.
Структура и масштаб бенчмарка
Бенчмарк состоит из 129 задач, охватывающих 10 основных доменов и 21 поддомен вычислительной биологии. В отличие от многих тестов, где данные идеально очищены, здесь модели предоставляются «грязные» наборы данных с техническими артефактами и проблемами контроля качества, что требует от ИИ глубокого рефлексивного анализа.
| Домен | Количество задач (n) | Примеры поддоменов |
|---|---|---|
| Клиническая генетика, PGx и диагностика | 26 | Интерпретация вариантов, фармакогеномика, пренатальный риск |
| Популяционная генетика | 21 | Адаптация, древняя ДНК, история популяций |
| Статистическая генетика | 17 | Ассоциативный анализ, каузальное картирование |
| Количественная генетика | 17 | Наследуемость, полигенное предсказание |
| Регуляторная омика | 17 | Регуляторные QTL, альтернативный сплайсинг |
| Функциональная геномика | 9 | Анализ хроматина, пространственная организация |
| Онкогенетика | 10 | Соматическая геномика, жидкая биопсия |
| Протеомика | 7 | Биомаркеры, протеомный анализ |
| Микробная геномика | 3 | Метагеномика |
| Форензическая генетика | 2 | Идентификация личности |
Синтетические данные и защита от «читерства»
Ключевая особенность GeneBench-Pro — использование синтетически сгенерированных данных. Авторы точно знают причинно-следственную структуру и процесс генерации данных. Это позволяет:
- Избегать ситуаций, где разные, но равноправные аналитические пути приводят к разным результатам (субъективность автора бенчмарка).
- Гарантировать, что фундаментальные ошибки в анализе приводят к провалу, даже если числовые результаты кажутся правдоподобными.
- Проводить абляционные исследования для проверки того, что правильный ответ достигается только через верный аналитический путь, а не через поиск узких мест или утечку информации.
Экспертная валидация
82 из 129 задач были проверены внешними экспертами, включая аспирантов, постдоков и профессоров (включая исследователей из UCLA). По их отзывам, задачи уровня GeneBench-Pro сопоставимы с работой аспиранта, требующей постоянной обратной связи от научного руководителя. Успешное прохождение теста означает, что ИИ-агент может стать эффективным помощником, ускоряющим и повышающим воспроизводимость научных исследований.
Источник: OpenAI ↗
