AI-новости11 мая 2026 г., 12:12 МСК

AI уже обходит врачей в ранней диагностике: модель OpenAI o1 показала до 67% точных решений

Фото новости

В новом исследовании модель OpenAI o1 попала в верный или почти верный диагноз в 67% случаев. У врачей скорой помощи было 50–55%. Разница особенно заметна там, где цена ошибки самая высокая, в первые минуты приёма.

Это не лабораторный тест на идеальных примерах. Модель проверяли на «грязных» случаях из реального отделения неотложной помощи. И да, речь про o1, которую уже считают не самой новой по меркам AI.

Самое важное: в хаосе приёмного покоя AI оказался точнее

страница Science о сравнении AI и врачей в ранней диагностике в ER
Скриншот: science.org

Самый сложный этап в ER (отделение неотложной помощи) это triage (первичная сортировка пациентов). Данных мало, людей много, решения нужны сразу. Именно здесь модель выиграла чаще всего.

Врач видит десятки пациентов за смену. Усталость растёт, контекст рвётся, риск промаха выше. У модели нет усталости, и она стабильно перебирает гипотезы по одному сценарию.

  • 67% у o1 против 50–55% у врачей на ранней диагностике.
  • Проверка шла на реальных клинических историях, а не на учебных кейсах.
  • Преимущество выросло именно на этапе первичной сортировки.

Если перевести на язык бизнеса, это как сотрудник, который не проседает в пиковый час. В медицине такой «пиковый час» бывает почти каждую смену.

Что реально изменилось для обычных людей

Раньше AI в больнице чаще был «вторым мнением». Теперь он всё ближе к роли системы clinical reasoning (клиническое логическое мышление). Это сдвиг не в интерфейсе, а в качестве решений.

Для пациента это значит одно. Вероятность правильного направления на старте может вырасти. А значит меньше потери времени между симптомом и нужным лечением.

Для врача это не замена, а усилитель темпа. AI может быстро выдать shortlist (короткий список) вероятных диагнозов. Врач проверяет, отсекает шум и принимает финальное решение.

  • Быстрее находить опасные состояния в первые 10–20 минут.
  • Снижать число «пропущенных» случаев в перегруженные часы.
  • Ровнее держать качество при большом потоке пациентов.

На практике это особенно важно в ночные смены и во время всплесков обращений. Там даже +10% точности могут спасать жизни.

Почему это произошло именно сейчас

Сильнее стали не только ответы, но и процесс. Модели лучше строят reasoning (логическое мышление) по шагам. Они реже «стреляют» одним красивым ответом без проверки альтернатив.

Плюс выросла устойчивость на неполных данных. В ER почти всегда не хватает части пазла. Хорошая модель умеет работать с неопределённостью, а не ломаться об неё.

Ещё один фактор это качество оценки. Исследователи смотрели не «вау-демо», а прикладную метрику. По сути это benchmark (тест производительности) на реальном клиническом хаосе.

Важно и то, что o1 уже не флагман. Если «вчерашняя» модель даёт такой результат, у новых поколений потенциал выше.

Ограничения, о которых нельзя молчать

Исследование не включало imaging (медицинскую визуализацию): CT (компьютерная томография) и X-ray (рентген). А именно снимки часто решают спорные случаи. Это заметное ограничение.

Ещё один предел это длительность наблюдения. Оценивали короткие эпизоды ER, а не длинные госпитальные истории. Значит выводы сильны для старта, но не для всей траектории лечения.

  • Нет данных по работе со снимками и полной диагностической цепочке.
  • Нет оценки на длительных госпитализациях и сложной динамике.
  • Нужны повторные исследования в разных клиниках и странах.

То есть это не «врачи больше не нужны». Это «в первых минутах AI уже очень силён».

Как применить это уже сейчас: 5 практичных шагов

Если вы руководите клиникой, стартапом в medtech (медицинские технологии) или продуктом для triage, можно действовать уже сегодня. Без громких обещаний и без риска «внедрили и забыли».

  1. Запустите пилот на одном типе кейсов, где высока цена задержки.
  2. Сделайте формат «AI предлагает, врач подтверждает».
  3. Мерьте три метрики: точность, время решения, долю пропусков.
  4. Добавьте audit trail (журнал проверок), чтобы видеть логику выбора.
  5. Регулярно обновляйте протоколы и обучайте команду на реальных примерах.

Для предпринимателей вывод простой. Рынок смещается от «чат-ассистентов» к системам принятия решений. Победят продукты, которые улучшают исход, а не только экономят клики.

Источник: Science.

Следующий шаг очевиден и немного тревожный. В критические минуты мы всё чаще будем доверять не самому уверенному голосу в кабинете, а самой точной системе под давлением.