От философии к государству: смена парадигмы
Поле AI Safety прошло путь от узкой группы философов и одиночных институтов (2005–2016) к эмпирическим техническим исследованиям и управлению. Ключевым моментом стало 2023 год, когда доминирование филантропических грантов (в первую очередь Open Philanthropy) сменилось государственным финансированием. Теперь в процесс вовлечены агентства из нескольких стран: UK AISI, ARIA, US AISI при NIST, NSF, CAISI в Канаде, AISI в Австралии, EU AI Office и DARPA GARD.
Три судьбы направлений: что выжило, а что исчезло
Анализ показывает, что новые направления не просто появляются, но и сталкиваются с тремя исходами: поглощение мейнстримом, тихое угасание или рост. Например, RLHF (Reinforcement Learning from Human Feedback) полностью впитался в основную машинную обучение, тогда как агентные основы (agent foundations) и ранняя макро-стратегия faded. В то же время интерпретируемость, оценки и контроль ИИ набирают обороты.
Разрыв между деньгами и вниманием
Научные публикации и финансирование движутся не синхронно. Интерпретируемость (Interpretability) получает научное внимание примерно в 37 раз больше, чем можно было бы ожидать от уровня её финансирования. Напротив, направление Governance (управление) получает больше денег, чем отражают публикации. Это указывает на то, что политический и регуляторный интерес опережает академическую базу.
Новый тип денег: венчурный капитал
Важно отметить появление отдельного потока венчурного капитала, который не суммируется с грантами, так как инвесторы ожидают финансовую отдачу. Зафиксировано около $268 млн венчурных инвестиций в стартапы безопасности:
| Компания | Раунд/Сумма | Направление |
|---|---|---|
| Goodfire | $50 млн (Series A) | Интерпретируемость |
| Gray Swan | $40 млн | Безопасность ИИ |
| Lakera | $20 млн | Безопасность ИИ |
| HiddenLayer | $50 млн | Безопасность ИИ |
| Protect AI | $108.5 млн (до поглощения Palo Alto за $634.5 млн) | Безопасность ИИ |
Методология: 323 проверенных факта
Исследование построено на базе из 323 документированных событий, 129 участников и 18 направлений за период с 2005 по июнь 2026 года. Авторы используют arXiv как прокси-метрику внимания, но корректируют данные на шум (например, исключая общие термины ML из запросов по интерпретируемости). Важно: количество публикаций — это не библиометрика, а индикатор интереса, а реальный объем активности лучше оценивать по деньгам и событиям.
2024–2026: Консолидация или пролиферация?
Последние два года стали рекордными по количеству новых организаций. Название «Safety» постепенно уходит из названий институтов: UK AISI стал AI Security Institute, US AISI стал CAISI, а Open Philanthropy переименовалась в Coefficient Giving. Это сигнализирует о том, что безопасность ИИ перестает быть нишевой темой и становится частью основной инфраструктуры технологического развития.
Источник: LessWrong ↗
