ИИ как оружие массового поражения
Разработчики суперинтеллекта, такие как OpenAI и Anthropic, инвестируют миллиарды в создание систем, способных превосходить человека в хакерстве и военных операциях. Исследование от 18 сентября 2026 года подчеркивает: системы уровня Anthropic Mythos уже являются автономным кибероружием. Уязвимость очевидна — после анонса превью Mythos хакеры получили доступ к системе в Discord менее чем за сутки. Если это смогли сделать энтузиасты, то государственные акторы могут украсть технологию за считанные часы, обойдя затраты на разработку в миллиарды долларов.
Три уровня ответственности за безопасность
Авторы предлагают ввести градацию ответственности в зависимости от того, как быстро ИИ-система попала в руки к злоумышленникам. Это создает экономические стимулы для инвестиций в безопасность:
| Время до компрометации | Квалификация | Последствия для компании и руководства |
|---|---|---|
| Более 1 года | Адекватная защита | Отсутствие ответственности |
| Менее 1 года | Недостаточная защита | Штраф пропорционально упущению; нет уголовной ответственности |
| Менее 3 месяцев | Халатность | Уголовная ответственность исполнителей; крупные штрафы |
| Менее 1 месяца | Грубая халатность | Ликвидация компании; пожизненный запрет на работу в ИИ для руководителей |
Необходимые меры: от регистрации до «убийственных выключателей»
Для немедленного снижения рисков предлагаются три направления действий с вариантами реализации:
- Регистрация (Necessary): Обязательная регистрация любых проектов, способных стать «оружийными» (включая системы, уязвимые к red-teaming), в государственных органах.
- Уголовная ответственность за утечки: Наказание разработчиков за раскрытие данных опасных моделей в ходе деятельности по улучшению функций (gain-of-function).
- Правительственные kill-switches: Создание механизмов, позволяющих государству принудительно останавливать критические инциденты с ИИ, аналогично законопроектам в США и Великобритании.
Почему этого недостаточно
Авторы подчеркивают, что эти меры — лишь «заплатки» (stopgap measures). Они не останавливают гонку вооружений к суперинтеллекту, которая, по оценкам экспертов, несет риск вымирания человечества к концу десятилетия. Единственным долгосрочным решением ControlAI называет полный международный запрет на разработку суперинтеллекта и режим «доверяй, но проверяй».
Источник: LessWrong ↗
