Исследования14 сентября 2026 г., 12:19 МСК🤖 Auto

ORQA: Тест на профпригодность ИИ. Кто лучший в медицине, а кто провалил стройку?

Исследователи представили ORQA — первый масштабный бенчмарк, оценивающий профессиональные знания LLM по реальным должностям. Топ-модели набрали лишь 60%, а некоторые профессии для ИИ остаются «слепыми зонами».

Баннер новости 7440

Проблема абстрактных тестов

Большинство существующих бенчмарков (MMLU, GPQA) проверяют общие знания или абстрактные навыки, которые лишь косвенно связаны с реальной работой. Это создает разрыв между «умным» чат-ботом и специалистом, способным выполнять профессиональные задачи. Авторы исследования из ORQA предлагают решение: связать стандарты профессий (O*NET) с доверенными источниками — регуляторными органами, лицензирующими организациями и правительственными публикациями.

Масштаб данных: 116 профессий, 480 вопросов

Методология ORQA сочетает автоматизированный пайплайн и ручную проверку экспертами. В датасет вошли 480 вопросов, сгенерированных на основе 187 различных веб-сайтов. Покрытие охватывает 116 профессий из всех 21 крупной группы классификатора SOC (Standard Occupational Classification). Каждый вопрос сфокусирован на конкретном навыке, необходимом для реальной работы, с возможностью отслеживания источника информации.

Результаты: разрыв между топами и «серединой»

В тестировании участвовали 15 передовых моделей. Лидерство разделили проприетарные гиганты, но даже их результаты далеки от совершенства. Открытые модели (open-weight) показали значительно более низкие результаты, что указывает на риск переоценки их профессиональных возможностей.

Категория моделей Примеры Средний балл Примечание
Топ-уровень (Frontier) Claude Opus 4.6, GPT-5.4, Claude Sonnet 4.6 58–62% Лучшие результаты, но с большими просадками по отдельным профессиям
Открытые модели (Open-weight) Различные SOTA open-source решения 33–41% Значительно уступают проприетарным аналогам

Профессия решает: медицина против «синих воротничков»

Самый интригующий вывод исследования — экстремальная вариативность результатов в зависимости от сферы. ИИ отлично справляется с задачами, требующими работы с текстами и стандартами, но проваливается в узкоспециализированных или физических областях.

  • Медицина: Профессии, связанные со здравоохранением, показали наивысший результат — 78%. Это объясняется обилием структурированных медицинских данных в обучающих выборках.
  • Административный персонал: Офисные работники и поддержка набрали около 40%.
  • Критические провалы: Для таких профессий, как Sheet Metal Workers (работники по металлу) или Fish and Game Wardens (инспекторы по охране рыб и дичи), точность предсказаний ИИ близка к нулю. Это указывает на то, что текущие LLM не обладают достаточным контекстом для узкопрофильных прикладных задач.

Почему это важно для индустрии

ORQA демонстрирует, что текущие LLM нельзя использовать как универсальных профессиональных ассистентов без серьезной фильтрации. Высокие баллы в медицине не гарантируют компетентность в инженерии или ремесленных профессиях. Методология ORQA предлагает масштабируемый путь для будущей оценки AI-агентов в конкретных отраслях, опираясь на реальные, а не абстрактные, требования рынка труда.

Источник: arXiv cs.CL ↗