Исследования29 сентября 2026 г., 05:22 МСК🤖 Auto

BioEVAL: AI в биотехе. Тест на PhD-уровне для ChatGPT, Gemini и Grok

Международная группа исследователей представила BioEVAL — первый глобальный бенчмарк для оценки способностей LLM к экспериментальному мышлению в биотехнологиях. Тест включает 359 сложных вопросов, требующих не просто фактов, а глубокого анализа.

Баннер новости 8474

От фактологии к экспериментальному мышлению

Традиционные бенчмарки для больших языковых моделей (LLM) часто сводятся к проверке фактической памяти. Однако для реального применения в науке этого недостаточно. Исследователи из 22 групп по всему миру создали BioEVAL (BioEngineering Validation of AI and LLMs) — специализированный тест, оценивающий способность моделей к экспериментальному рассуждению в области биотехнологий. Это переход от вопроса «что известно?» к вопросу «как это проверить и интерпретировать?».

Структура теста: 608 задач PhD-уровня

Бенчмарк охватывает 11 основных поддисциплин биотехнологии. Изначально было создано 608 задач, прошедших строгую экспертизу. После аудита и удаления 21 спорного вопроса (из-за неоднозначности или ошибок), финальная выборка для статистики составила 359 вопросов с множественным выбором (MCQ). Остальные задачи включают синтез литературы и работу с изображениями.

Тип задачи Количество Описание
Множественный выбор (MCQ) 359 Вопросы, требующие логического вывода и понимания экспериментальных протоколов.
Синтез литературы 218 Задачи на обобщение научных данных и выявление связей между исследованиями.
Мультимодальные задачи 10 Интерпретация экспериментальных изображений и графиков.

Результаты: Лидеры и ограничения

В тесте участвовали как облачные модели (ChatGPT, Gemini, Grok), так и локальные решения, работающие на потребительских GPU. Результаты показали значительный разброс в зависимости от сложности задачи и области знаний.

  • MCQ (359 вопросов): Лучшие модели достигли точности до 90%. Однако в сложных поддисциплинах этот показатель падал, выявляя пробелы в логическом выводе.
  • Синтез литературы: Оценка сходства ответов эталонным решениям составила 0.72 (по шкале, близкой к Cosine Similarity). Это указывает на то, что модели умеют структурировать информацию, но часто упускают тонкие нюансы.
  • Мультимодальный анализ: На малой выборке из 10 задач с интерпретацией изображений точность составила 80%. Это перспективный, но пока узкий сегмент.

Почему это важно для индустрии

BioEVAL демонстрирует, что современные LLM уже способны решать задачи на уровне аспиранта (PhD-level) в узкоспециализированных областях. Однако вариативность результатов между поддисциплинами подчеркивает необходимость дообучения моделей на специфических экспериментальных данных. Платформа BioEVAL остается открытой для расширения, что позволяет сообществу постоянно обновлять тесты по мере появления новых биотехнологических прорывов.

Источник: arXiv cs.AI ↗