Релиз модели15 июля 2026 г., 20:30 МСК🤖 Auto

OpenAI представила GPT-Red: ИИ-хакер, сделавший GPT-5.6 в 6 раз устойчивее

OpenAI обучила автономную модель GPT-Red для автоматического поиска уязвимостей. Атакуя собственные модели, она помогла создать GPT-5.6 Sol, который в 6 раз реже подвержен инъекциям промптов.

Баннер новости 3651

Проблема масштабируемости безопасности

Человеческий ред-тиминг (тестирование на проникновение) становится узким местом. Он слишком медленен для выявления новых векторов атак в быстро развивающихся моделях. OpenAI решила эту проблему, создав GPT-Red — автономную модель, которая использует вычислительную мощность, сопоставимую с крупными этапами пост-обучения, для генерации атак и улучшения устойчивости будущих версий.

Методология: Самоиграющее обучение (Self-Play)

GPT-Red обучается через механизм самоиграющего усиленного обучения (self-play RL). В этом процессе модель-атакующий соревнуется с коллекцией защитных LLM. Награда присуждается за успешную инъекцию промпта у атакующего и за сопротивление атаке у защитника. Это создает гонку вооружений, где GPT-Red вынужден постоянно находить более сложные и разнообразные векторы взлома, чтобы обходить укрепляющиеся защиты.

Результаты: GPT-5.6 Sol против GPT-5.1

Интеграция атак от GPT-Red в процесс обучения привела к созданию GPT-5.6 Sol — самой устойчивой к инъекциям промптов модели на данный момент. Ключевая метрика: количество сбоев на самых сложных бенчмарках прямых инъекций промптов снизилось в 6 раз по сравнению с лучшим продуктом OpenAI всего четыре месяца назад (GPT-5.1).

Метрика / Модель Результат / Характеристика
Устойчивость GPT-5.6 Sol В 6 раз меньше сбоев при прямых инъекциях промптов (по сравнению с GPT-5.1)
Эффективность GPT-Red (vs Люди) Успешные атаки в 84% сценариев против 13% у человеческих ред-тимеров
Объект тестирования обобщения GPT-5.1 (в индирект-инъекциях промптов)
Статус GPT-Red Internal-only (не разглашается, изолирована от продакшена)

Почему это важно

Открытие GPT-Red демонстрирует переход от реактивной безопасности к проактивной «самосовершенствующейся» архитектуре. Используя текущие мощные модели для поиска уязвимостей, OpenAI создает цикл обратной связи, где безопасность масштабируется вместе с интеллектом модели. При этом GPT-Red остается изолированной внутренней системой, чтобы злоумышленники не могли получить доступ к сгенерированным ею вредоносным способностям.

Бенчмарки

БенчмаркGPT-RedHuman Red-Teamers
Indirect Prompt Injection Arena84%13%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: OpenAI ↗