Исследования15 июля 2026 г., 06:16 МСК🤖 Auto

AI Safety: рост с 0,3% до 8,3% за 7 лет. Кто и как исследует безопасность ИИ

Масштабный анализ 55 000 статей с топ-конференций ML (ICLR, ICML, NeurIPS) показал 25-кратный рост доли исследований по безопасности ИИ. Эксперты отмечают сдвиг от простого увеличения числа работ к необходимости повышения их качества и влияния.

Баннер новости 3595

Масштаб исследования и методология

Исследователи проанализировали все принятые статьи на конференциях ICLR, ICML и NeurIPS с 2019 по 2026 год. Всего в выборку вошло 55 794 работы. Для классификации использовалась языковая модель DeepSeek V4 Flash, которая анализировала заголовки и аннотации, распределяя статьи по четырем категориям: безопасность ИИ (frontier & misalignment), правдивость/надежность, этика/справедливость и общие возможности (general capabilities).

Каждая статья, отнесенная к безопасности, была дополнительно классифицирована по 17 поддоменам (например, интерпретируемость, обучение выравниванию, adversarial robustness) и оценена по 7-балльной шкале центральной значимости для безопасности. Также проведен анализ полных текстов для выявления организаций-авторов и спонсоров.

Взрывной рост доли безопасности ИИ

Доля статей по безопасности ИИ среди всех принятых работ выросла с 0,3% в 2019 году до 8,3% в 2026 году. Это увеличение в 25 раз. При этом общее количество принятых статей на конференциях также росло, но темпы роста «безопасных» публикаций значительно опережали общий рост поля.

Год Всего принятых статей Статей по безопасности ИИ Доля безопасности
2019 2 701 0,3%
2020 3 669 26 0,7%
2021 4 674 31 0,7%
2022 4 998 48 1,0%
2023 6 619 101 1,5%
2024 8 905 370 4,2%
2025 12 249 744 6,1%
2026* 11 979 999 8,3%

*2026 год включает данные ICLR и ICML; NeurIPS 2026 еще не состоялся.

Что именно изучают: смена приоритетов

Структура исследований по безопасности ИИ претерпела изменения. Если в 2020–2022 годах доминировала adversarial robustness (устойчивость к атакам), то с 2023 года лидером стала интерпретируемость (interpretability). Появились новые направления, такие как оценка опасных возможностей (dangerous-capability evals) и схеминг/обман (scheming & deception), которые ранее были практически незаметны.

Поддомен безопасности Количество статей (всего за период)
Интерпретируемость (Interpretability) 657
Обучение выравниванию (Alignment Training) 457
Adversarial Robustness 298
Red-Teaming 286
Контроль и средства защиты (Control Safeguards) 199
Масштабируемый надзор (Scalable Oversight) 164
Оценка опасных возможностей (Dangerous Capability Evals) 55
Биориски (Biorisk Monitoring) 53
Схеминг и обман (Scheming & Deception) 34
Agent Foundations 27
Стратегия и управление (Policy & Governance) 26

Кто пишет: Индустрия против Экосистемы

Анализ affiliations показывает доминирование крупных технологических лабораторий. По количеству упоминаний в соавторстве лидируют:

  • Google DeepMind: 107 статей
  • OpenAI: 74 статьи
  • Anthropic: 51 статья

Однако, если считать организации как «ведущих авторов» (primary org), то на первом месте находятся специализированные исследовательские центры: MATS (48 статей), Mila (46) и Google DeepMind (42). Среди фондеров безоговорочный лидер — Open Philanthropy, упомянутая в 120 статьях, что в 10 раз больше, чем у следующего спонсора (Long-Term Future Fund: 10).

Почему это важно: тренд на качество

Ключевой вывод исследования заключается в том, что доля статей, поддерживаемых специализированной экосистемой безопасности (MATS, Mila, фонды), снижается на фоне общего роста поля. В 2019 году 5 из 9 статей имели поддержку организаций, а в 2026 году — 150 из 954. Основной прирост обеспечивают исследователи вне специализированной экосистемы.

Авторы отмечают, что это требует пересмотра стратегий: вместо простого увеличения количества публикаций и исследователей, эффективные вмешательства должны быть направлены на повышение качества, релевантности тем и долгосрочного влияния уже существующих исследований, а также на диверсификацию поля.

Источник: LessWrong ↗