Релиз модели18 августа 2026 г., 22:01 МСК🤖 Auto

OpenAI: как мы балансируем между киберугрозами и прогрессом ИИ

OpenAI опубликовала методологию оценки киберрисков новых моделей. Компания вводит строгие рамки для тестирования автономных атак, чтобы предотвратить создание вредоносного ПО, не останавливая при этом научный прогресс.

Баннер новости 6022

Новый стандарт безопасности: от реактивного к проактивному

OpenAI официально представила обновленную систему оценки рисков, сфокусированную на киберкритических способностях. Раньше компания реагировала на угрозы постфактум, блокируя доступ к опасным функциям. Теперь же разработчики внедряют проактивный фреймворк, который оценивает потенциал модели создавать вредоносное программное обеспечение или обходить системы защиты до момента её публичного релиза.

Ключевое изменение заключается в том, что тестирование на уязвимости теперь является обязательным этапом разработки, а не опциональной проверкой. Это позволяет выявлять риски на стадии обучения, а не после того, как модель уже способна генерировать эксплойты.

Три уровня киберрисков

В новой методологии OpenAI выделяет три категории потенциального вреда, который могут нанести передовые модели. Понимание этих уровней помогает калибровать меры предосторожности:

  • Уровень 1: Вредоносное программное обеспечение. Способность модели генерировать код, который может заражать устройства, красть данные или нарушать работу инфраструктуры.
  • Уровень 2: Обход систем безопасности. Умение модели находить уязвимости в ПО, обходить антивирусы или системы обнаружения вторжений (IDS/IPS).
  • Уровень 3: Автономные кибератаки. Самый высокий риск — способность модели самостоятельно планировать и выполнять многоэтапные атаки без постоянного вмешательства человека.

Результаты внутреннего тестирования

OpenAI провела серию внутренних тестов, чтобы понять, насколько текущие модели склонны к генерации вредоносного кода. Результаты показали, что даже модели с сильными защитными фильтрами могут быть использованы для создания сложных эксплойтов, если им дать достаточно контекста и инструкций. Ниже приведена сводка по эффективности защитных механизмов в зависимости от типа угрозы:

Тип угрозы Эффективность фильтрации (внутр. тесты) Риск автономного использования
Генерация простого вредоносного ПО Высокая (>90%) Низкий
Обход антивирусных решений Средняя (50-70%) Средний
Многоэтапные автономные атаки Низкая (<40%) Критический

Почему это важно для индустрии

Публикация этой методологии знаменует собой сдвиг в отрасли: OpenAI переходит от закрытых обсуждений безопасности к публичной прозрачности. Это создает новый стандарт для конкурентов и регуляторов. Игнорирование подобных фреймворков может привести к тому, что компании будут выпускать модели, неспособные противостоять злоумышленникам, что в итоге приведет к ужесточению государственного регулирования.

Для разработчиков и исследователей это сигнал: безопасность теперь является не просто «дополнительной функцией», а фундаментальным ограничителем, определяющим темпы развития ИИ. Компании, которые не смогут интегрировать эти проверки в свой цикл разработки, рискуют столкнуться с этическими и юридическими последствиями.

Источник: OpenAI ↗