Релиз модели30 июня 2026 г., 13:16 МСК🤖 Auto

ATHENA-R1: AI-агент для лечения, победивший GPT-5 на 17.8%

Команда MIT и партнеров представила ATHENA-R1 — первый AI-агент, использующий обучение с подкреплением для рассуждений о лечении. Система превзошла GPT-5 в выборе терапии, опираясь на 212 биомедицинских инструментов.

Баннер новости 2558

Революция в клинических рассуждениях

Команда исследователей, включая авторов из MIT и ATHENA-R1 Evaluation Consortium, представила ATHENA-R1 — специализированный AI-агент, предназначенный для принятия решений о лечении. В отличие от обычных языковых моделей, ATHENA-R1 работает с 212 биомедицинскими инструментами и анализирует все препараты, одобренные FDA с 1939 года. Агент итеративно собирает доказательства, выявляет недостающую информацию и проверяет противопоказания, прежде чем сделать вывод.

Двухуровневое обучение без людей

Ключевое достижение — метод обучения без человеческих аннотаций. Используется двухуровневая система:

  • Многоагентная система: строит траектории рассуждений для обучения с учителем (SFT).
  • Обучение с подкреплением (RL): оптимизирует качество сбора доказательств, логическую непротиворечивость и использование инструментов на основе научных вознаграждений.

Результаты против GPT-5

На пяти бенчмарках, включающих 3 168 задач по рассуждению о лекарствах и 456 клинических случаев, ATHENA-R1 продемонстрировал значительное превосходство над GPT-5. Ниже приведены ключевые метрики точности:

Метрика ATHENA-R1 GPT-5 Преимущество
Открытые рассуждения о лекарствах 94.7% 76.9% +17.8 п.п.
Рассуждения о лечении (клинические) 82.9% 72.2% +10.7 п.п.

Валидация врачами и реальными данными

В слепом тестировании эксперты из 28 организаций по редким заболеваниям предпочли ATHENA-R1 референсным моделям по всем критериям. Врачи высоко оценили работу агента в сложных случаях сердечно-сосудистых и инфекционных заболеваний.

Гипотезы о побочных эффектах, сгенерированные агентом, были протестированы на электронных медицинских картах 5.4 миллиона пациентов. Выявленные корреляции показали скорректированные отношения шансов (adjusted odds ratios) в диапазоне 1.48–1.84, при этом ложных срабатываний на контрольных группах не обнаружено.

Источник: arXiv cs.AI ↗