Серьезная угроза безопасности ИИ
Компания Anthropic официально заявила, что ее языковая модель Claude успешно заблокировала попытки злоумышленников, связанных с государственными структурами, провести исследования в области биологического оружия. Атака была не просто спамом или тестом на уязвимости, а сложной операцией по инженерии более смертоносных вирусов.
Методы обхода защиты
Злоумышленники использовали изощренные методы для обхода систем безопасности и региональных блокировок. Ключевой особенностью атаки стало использование скрытых аккаунтов, которые маскировались под пользователей из США. Это позволяло атакующим избегать географических ограничений и скрывать свое истинное происхождение от систем мониторинга Anthropic.
Технические детали инцидента
Атака была направлена на то, чтобы заставить модель Claude сгенерировать инструкции или данные, способные привести к созданию патогенов с повышенной летальностью. Система безопасности Claude идентифицировала эти запросы как вредоносные и предотвратила генерацию опасного контента. Это подтверждает эффективность встроенных в модель механизмов этической фильтрации даже при целенаправленных попытках их обхода.
Значение для индустрии
Этот инцидент подчеркивает растущие риски использования ИИ в военных и деструктивных целях. Тот факт, что атака была спонсируема государством, указывает на то, что крупные игроки в геополитике уже рассматривают ИИ как инструмент биологической войны. Успешное предотвращение такой атаки демонстрирует, что разработчики ИИ должны продолжать инвестировать в безопасность моделей, чтобы противостоять подобным угрозам.
Источник: Tom's Hardware ↗
