Исследования10 июля 2026 г., 04:17 МСК🤖 Auto

Генезис AI Safety: как рождаются и умирают направления (2005–2026)

Исследование Elena Ericheva анализирует 323 события в безопасности ИИ, показывая разрыв между финансированием и научным вниманием, а также сдвиг от философии к государственному регулированию.

Баннер новости 3262

От философии к государству: смена парадигмы

Поле AI Safety прошло путь от узкой группы философов и одиночных институтов (2005–2016) к эмпирическим техническим исследованиям и управлению. Ключевым моментом стало 2023 год, когда доминирование филантропических грантов (в первую очередь Open Philanthropy) сменилось государственным финансированием. Теперь в процесс вовлечены агентства из нескольких стран: UK AISI, ARIA, US AISI при NIST, NSF, CAISI в Канаде, AISI в Австралии, EU AI Office и DARPA GARD.

Три судьбы направлений: что выжило, а что исчезло

Анализ показывает, что новые направления не просто появляются, но и сталкиваются с тремя исходами: поглощение мейнстримом, тихое угасание или рост. Например, RLHF (Reinforcement Learning from Human Feedback) полностью впитался в основную машинную обучение, тогда как агентные основы (agent foundations) и ранняя макро-стратегия faded. В то же время интерпретируемость, оценки и контроль ИИ набирают обороты.

Разрыв между деньгами и вниманием

Научные публикации и финансирование движутся не синхронно. Интерпретируемость (Interpretability) получает научное внимание примерно в 37 раз больше, чем можно было бы ожидать от уровня её финансирования. Напротив, направление Governance (управление) получает больше денег, чем отражают публикации. Это указывает на то, что политический и регуляторный интерес опережает академическую базу.

Новый тип денег: венчурный капитал

Важно отметить появление отдельного потока венчурного капитала, который не суммируется с грантами, так как инвесторы ожидают финансовую отдачу. Зафиксировано около $268 млн венчурных инвестиций в стартапы безопасности:

Компания Раунд/Сумма Направление
Goodfire $50 млн (Series A) Интерпретируемость
Gray Swan $40 млн Безопасность ИИ
Lakera $20 млн Безопасность ИИ
HiddenLayer $50 млн Безопасность ИИ
Protect AI $108.5 млн (до поглощения Palo Alto за $634.5 млн) Безопасность ИИ

Методология: 323 проверенных факта

Исследование построено на базе из 323 документированных событий, 129 участников и 18 направлений за период с 2005 по июнь 2026 года. Авторы используют arXiv как прокси-метрику внимания, но корректируют данные на шум (например, исключая общие термины ML из запросов по интерпретируемости). Важно: количество публикаций — это не библиометрика, а индикатор интереса, а реальный объем активности лучше оценивать по деньгам и событиям.

2024–2026: Консолидация или пролиферация?

Последние два года стали рекордными по количеству новых организаций. Название «Safety» постепенно уходит из названий институтов: UK AISI стал AI Security Institute, US AISI стал CAISI, а Open Philanthropy переименовалась в Coefficient Giving. Это сигнализирует о том, что безопасность ИИ перестает быть нишевой темой и становится частью основной инфраструктуры технологического развития.

Источник: LessWrong ↗