От поиска фактов к клиническому мышлению
30 июня 2026 года OpenAI опубликовала детали GeneBench-Pro — нового стандарта оценки способностей больших языковых моделей (LLM) в области геномики и биомедицины. В отличие от предыдущих тестов, где модели часто справлялись с простым извлечением информации, GeneBench-Pro требует от AI выполнения сложных многошаговых вычислений, работы с шумными данными и принятия решений, влияющих на здоровье пациентов.
Ключевая особенность бенчмарка: модели необходимо обрабатывать реальные экспериментальные данные (синтетические, но основанные на реальных протоколах), проводить статистический анализ и предоставлять ответ в строгом формате JSON, обосновывая каждый шаг. Ошибка в логике или расчете приводит к провалу, даже если итоговая цифра близка к верной.
Четыре уровня сложности: от онкологии до генетики
Бенчмарк состоит из 10 кейс-стади, охватывающих различные аспекты биомедицины. Ниже приведены примеры задач, которые решают модели, демонстрирующие разницу в подходах к обработке данных.
| Категория | Задача | Ключевые метрики и входные данные | Сложность |
|---|---|---|---|
| Соматическая онкология | Оценка пользы ингибитора TXR1 при структурных вариациях (SV) | Данные реестра MTB: возраст, ECOG, prior lines. Расчет net clinical utility = benefit - 0.35 * toxicity. | Высокая: требуется учет токсичности и пользы в пунктах процента |
| Функциональная геномика | Валидация CRISPR-мишеней: lncRNA vs соседние гены | Данные скрининга (log2 growth), GC-состав гидов, расстояния до TSS. Разделение эффектов lncRNA и соседей. | Критическая: контроль ложноположительных срабатываний из-за локальных эффектов |
| Статистическая генетика | Приоритизация мишеней лекарств через cis-MVMR | Сводные статистики ассоциаций (beta, SE, pval), LD-референс. Расчет логарифма шансов (log-odds) на 1 SD. | Экстремальная: учет плейотропии, winner's curse и корреляции локусов |
| Клиническая геномика | Оценка остаточного риска носительства DRX1 | Антропометрические данные, калибровка по этносам, учет псевдогенов и CNV. | Высокая: необходимость точной калибровки assay под конкретную популяцию |
Почему это важно для индустрии
GeneBench-Pro закрывает критический пробел в оценке AI-систем. Ранние модели могли «галлюцинировать» медицинские рекомендации, опираясь на общие паттерны текста. Новый бенчмарк проверяет способность модели:
- Работать с неструктурированными биологическими данными: модели нужно самостоятельно извлекать признаки из таблиц с координатами хромосом, частотами аллелей и уровнями экспрессии.
- Применять строгую статистику: требуется использование методов, таких как многомерное менделевское рандомизирование (MVMR) и контроль множественного тестирования.
- Соблюдать клинические протоколы: ответы должны быть оформлены в виде валидного JSON без лишнего текста, что имитирует интеграцию AI в реальные медицинские информационные системы.
Успешное прохождение GeneBench-Pro становится новым «золотым стандартом» для моделей, претендующих на роль ассистентов врачей или исследователей в фармацевтике. OpenAI подчеркивает, что оценка проводится не только по числовой точности, но и по качеству аналитического рассуждения (reasoning), что делает этот тест одним из самых сложных в области научного AI на сегодняшний день.
Источник: OpenAI ↗
