Революция в клинических рассуждениях
Команда исследователей, включая авторов из MIT и ATHENA-R1 Evaluation Consortium, представила ATHENA-R1 — специализированный AI-агент, предназначенный для принятия решений о лечении. В отличие от обычных языковых моделей, ATHENA-R1 работает с 212 биомедицинскими инструментами и анализирует все препараты, одобренные FDA с 1939 года. Агент итеративно собирает доказательства, выявляет недостающую информацию и проверяет противопоказания, прежде чем сделать вывод.
Двухуровневое обучение без людей
Ключевое достижение — метод обучения без человеческих аннотаций. Используется двухуровневая система:
- Многоагентная система: строит траектории рассуждений для обучения с учителем (SFT).
- Обучение с подкреплением (RL): оптимизирует качество сбора доказательств, логическую непротиворечивость и использование инструментов на основе научных вознаграждений.
Результаты против GPT-5
На пяти бенчмарках, включающих 3 168 задач по рассуждению о лекарствах и 456 клинических случаев, ATHENA-R1 продемонстрировал значительное превосходство над GPT-5. Ниже приведены ключевые метрики точности:
| Метрика | ATHENA-R1 | GPT-5 | Преимущество |
|---|---|---|---|
| Открытые рассуждения о лекарствах | 94.7% | 76.9% | +17.8 п.п. |
| Рассуждения о лечении (клинические) | 82.9% | 72.2% | +10.7 п.п. |
Валидация врачами и реальными данными
В слепом тестировании эксперты из 28 организаций по редким заболеваниям предпочли ATHENA-R1 референсным моделям по всем критериям. Врачи высоко оценили работу агента в сложных случаях сердечно-сосудистых и инфекционных заболеваний.
Гипотезы о побочных эффектах, сгенерированные агентом, были протестированы на электронных медицинских картах 5.4 миллиона пациентов. Выявленные корреляции показали скорректированные отношения шансов (adjusted odds ratios) в диапазоне 1.48–1.84, при этом ложных срабатываний на контрольных группах не обнаружено.
Источник: arXiv cs.AI ↗
