Масштаб исследования и методология
Исследователи проанализировали все принятые статьи на конференциях ICLR, ICML и NeurIPS с 2019 по 2026 год. Всего в выборку вошло 55 794 работы. Для классификации использовалась языковая модель DeepSeek V4 Flash, которая анализировала заголовки и аннотации, распределяя статьи по четырем категориям: безопасность ИИ (frontier & misalignment), правдивость/надежность, этика/справедливость и общие возможности (general capabilities).
Каждая статья, отнесенная к безопасности, была дополнительно классифицирована по 17 поддоменам (например, интерпретируемость, обучение выравниванию, adversarial robustness) и оценена по 7-балльной шкале центральной значимости для безопасности. Также проведен анализ полных текстов для выявления организаций-авторов и спонсоров.
Взрывной рост доли безопасности ИИ
Доля статей по безопасности ИИ среди всех принятых работ выросла с 0,3% в 2019 году до 8,3% в 2026 году. Это увеличение в 25 раз. При этом общее количество принятых статей на конференциях также росло, но темпы роста «безопасных» публикаций значительно опережали общий рост поля.
| Год | Всего принятых статей | Статей по безопасности ИИ | Доля безопасности |
|---|---|---|---|
| 2019 | 2 701 | — | 0,3% |
| 2020 | 3 669 | 26 | 0,7% |
| 2021 | 4 674 | 31 | 0,7% |
| 2022 | 4 998 | 48 | 1,0% |
| 2023 | 6 619 | 101 | 1,5% |
| 2024 | 8 905 | 370 | 4,2% |
| 2025 | 12 249 | 744 | 6,1% |
| 2026* | 11 979 | 999 | 8,3% |
*2026 год включает данные ICLR и ICML; NeurIPS 2026 еще не состоялся.
Что именно изучают: смена приоритетов
Структура исследований по безопасности ИИ претерпела изменения. Если в 2020–2022 годах доминировала adversarial robustness (устойчивость к атакам), то с 2023 года лидером стала интерпретируемость (interpretability). Появились новые направления, такие как оценка опасных возможностей (dangerous-capability evals) и схеминг/обман (scheming & deception), которые ранее были практически незаметны.
| Поддомен безопасности | Количество статей (всего за период) |
|---|---|
| Интерпретируемость (Interpretability) | 657 |
| Обучение выравниванию (Alignment Training) | 457 |
| Adversarial Robustness | 298 |
| Red-Teaming | 286 |
| Контроль и средства защиты (Control Safeguards) | 199 |
| Масштабируемый надзор (Scalable Oversight) | 164 |
| Оценка опасных возможностей (Dangerous Capability Evals) | 55 |
| Биориски (Biorisk Monitoring) | 53 |
| Схеминг и обман (Scheming & Deception) | 34 |
| Agent Foundations | 27 |
| Стратегия и управление (Policy & Governance) | 26 |
Кто пишет: Индустрия против Экосистемы
Анализ affiliations показывает доминирование крупных технологических лабораторий. По количеству упоминаний в соавторстве лидируют:
- Google DeepMind: 107 статей
- OpenAI: 74 статьи
- Anthropic: 51 статья
Однако, если считать организации как «ведущих авторов» (primary org), то на первом месте находятся специализированные исследовательские центры: MATS (48 статей), Mila (46) и Google DeepMind (42). Среди фондеров безоговорочный лидер — Open Philanthropy, упомянутая в 120 статьях, что в 10 раз больше, чем у следующего спонсора (Long-Term Future Fund: 10).
Почему это важно: тренд на качество
Ключевой вывод исследования заключается в том, что доля статей, поддерживаемых специализированной экосистемой безопасности (MATS, Mila, фонды), снижается на фоне общего роста поля. В 2019 году 5 из 9 статей имели поддержку организаций, а в 2026 году — 150 из 954. Основной прирост обеспечивают исследователи вне специализированной экосистемы.
Авторы отмечают, что это требует пересмотра стратегий: вместо простого увеличения количества публикаций и исследователей, эффективные вмешательства должны быть направлены на повышение качества, релевантности тем и долгосрочного влияния уже существующих исследований, а также на диверсификацию поля.
Источник: LessWrong ↗
