Релиз модели30 июня 2026 г., 22:31 МСК🤖 Auto

OpenAI представила GeneBench-Pro: тест на гениальность для AI в медицине

OpenAI выпустила сложный бенчмарк GeneBench-Pro, требующий от моделей не просто ответа, а глубокого статистического анализа и клинического рассуждения в условиях неопределенности.

Баннер новости 2602

От поиска фактов к клиническому мышлению

30 июня 2026 года OpenAI опубликовала детали GeneBench-Pro — нового стандарта оценки способностей больших языковых моделей (LLM) в области геномики и биомедицины. В отличие от предыдущих тестов, где модели часто справлялись с простым извлечением информации, GeneBench-Pro требует от AI выполнения сложных многошаговых вычислений, работы с шумными данными и принятия решений, влияющих на здоровье пациентов.

Ключевая особенность бенчмарка: модели необходимо обрабатывать реальные экспериментальные данные (синтетические, но основанные на реальных протоколах), проводить статистический анализ и предоставлять ответ в строгом формате JSON, обосновывая каждый шаг. Ошибка в логике или расчете приводит к провалу, даже если итоговая цифра близка к верной.

Четыре уровня сложности: от онкологии до генетики

Бенчмарк состоит из 10 кейс-стади, охватывающих различные аспекты биомедицины. Ниже приведены примеры задач, которые решают модели, демонстрирующие разницу в подходах к обработке данных.

Категория Задача Ключевые метрики и входные данные Сложность
Соматическая онкология Оценка пользы ингибитора TXR1 при структурных вариациях (SV) Данные реестра MTB: возраст, ECOG, prior lines. Расчет net clinical utility = benefit - 0.35 * toxicity. Высокая: требуется учет токсичности и пользы в пунктах процента
Функциональная геномика Валидация CRISPR-мишеней: lncRNA vs соседние гены Данные скрининга (log2 growth), GC-состав гидов, расстояния до TSS. Разделение эффектов lncRNA и соседей. Критическая: контроль ложноположительных срабатываний из-за локальных эффектов
Статистическая генетика Приоритизация мишеней лекарств через cis-MVMR Сводные статистики ассоциаций (beta, SE, pval), LD-референс. Расчет логарифма шансов (log-odds) на 1 SD. Экстремальная: учет плейотропии, winner's curse и корреляции локусов
Клиническая геномика Оценка остаточного риска носительства DRX1 Антропометрические данные, калибровка по этносам, учет псевдогенов и CNV. Высокая: необходимость точной калибровки assay под конкретную популяцию

Почему это важно для индустрии

GeneBench-Pro закрывает критический пробел в оценке AI-систем. Ранние модели могли «галлюцинировать» медицинские рекомендации, опираясь на общие паттерны текста. Новый бенчмарк проверяет способность модели:

  • Работать с неструктурированными биологическими данными: модели нужно самостоятельно извлекать признаки из таблиц с координатами хромосом, частотами аллелей и уровнями экспрессии.
  • Применять строгую статистику: требуется использование методов, таких как многомерное менделевское рандомизирование (MVMR) и контроль множественного тестирования.
  • Соблюдать клинические протоколы: ответы должны быть оформлены в виде валидного JSON без лишнего текста, что имитирует интеграцию AI в реальные медицинские информационные системы.

Успешное прохождение GeneBench-Pro становится новым «золотым стандартом» для моделей, претендующих на роль ассистентов врачей или исследователей в фармацевтике. OpenAI подчеркивает, что оценка проводится не только по числовой точности, но и по качеству аналитического рассуждения (reasoning), что делает этот тест одним из самых сложных в области научного AI на сегодняшний день.

Источник: OpenAI ↗