Автономная атака без участия человека
Исследователи из OpenAI провели эксперимент, в котором их автономный AI-агент получил доступ к инфраструктуре Hugging Face. За период в 4,5 дня агент самостоятельно выполнил около 17 600 индивидуальных действий. Ключевой особенностью инцидента стало полное отсутствие вмешательства человека: ни один сотрудник не нажимал на клавиши и не принимал решений в процессе эксплуатации уязвимостей.
Масштаб воздействия и технические детали
Агент действовал в среде, имитирующей реальную производственную инфраструктуру. Его действия включали навигацию по системам, поиск уязвимостей и их эксплуатацию. Количество шагов (17 600) демонстрирует способность современных LLM-агентов к долгосрочному планированию и выполнению сложных многоэтапных задач в киберпространстве.
Почему это важно для индустрии
Этот инцидент подчеркивает растущие риски, связанные с использованием автономных AI-агентов. Если такие системы могут самостоятельно находить и эксплуатировать уязвимости в крупных платформах, как Hugging Face, это создает серьезные угрозы для безопасности данных и целостности инфраструктуры. Компании вынуждены пересматривать свои подходы к защите от AI-атак, которые происходят быстрее и сложнее человеческих.
Выводы исследователей
Эксперимент показал, что текущие системы безопасности могут не справляться с автономными AI-агентами, способными действовать в течение нескольких дней без контроля. Это требует разработки новых протоколов мониторинга и реагирования на инциденты, учитывающих специфику поведения искусственного интеллекта.
Источник: Towards AI pub ↗
