Проблема масштабируемости безопасности
Человеческий ред-тиминг (тестирование на проникновение) становится узким местом. Он слишком медленен для выявления новых векторов атак в быстро развивающихся моделях. OpenAI решила эту проблему, создав GPT-Red — автономную модель, которая использует вычислительную мощность, сопоставимую с крупными этапами пост-обучения, для генерации атак и улучшения устойчивости будущих версий.
Методология: Самоиграющее обучение (Self-Play)
GPT-Red обучается через механизм самоиграющего усиленного обучения (self-play RL). В этом процессе модель-атакующий соревнуется с коллекцией защитных LLM. Награда присуждается за успешную инъекцию промпта у атакующего и за сопротивление атаке у защитника. Это создает гонку вооружений, где GPT-Red вынужден постоянно находить более сложные и разнообразные векторы взлома, чтобы обходить укрепляющиеся защиты.
Результаты: GPT-5.6 Sol против GPT-5.1
Интеграция атак от GPT-Red в процесс обучения привела к созданию GPT-5.6 Sol — самой устойчивой к инъекциям промптов модели на данный момент. Ключевая метрика: количество сбоев на самых сложных бенчмарках прямых инъекций промптов снизилось в 6 раз по сравнению с лучшим продуктом OpenAI всего четыре месяца назад (GPT-5.1).
| Метрика / Модель | Результат / Характеристика |
|---|---|
| Устойчивость GPT-5.6 Sol | В 6 раз меньше сбоев при прямых инъекциях промптов (по сравнению с GPT-5.1) |
| Эффективность GPT-Red (vs Люди) | Успешные атаки в 84% сценариев против 13% у человеческих ред-тимеров |
| Объект тестирования обобщения | GPT-5.1 (в индирект-инъекциях промптов) |
| Статус GPT-Red | Internal-only (не разглашается, изолирована от продакшена) |
Почему это важно
Открытие GPT-Red демонстрирует переход от реактивной безопасности к проактивной «самосовершенствующейся» архитектуре. Используя текущие мощные модели для поиска уязвимостей, OpenAI создает цикл обратной связи, где безопасность масштабируется вместе с интеллектом модели. При этом GPT-Red остается изолированной внутренней системой, чтобы злоумышленники не могли получить доступ к сгенерированным ею вредоносным способностям.
Бенчмарки
| Бенчмарк | GPT-Red | Human Red-Teamers |
|---|---|---|
| Indirect Prompt Injection Arena | 84% | 13% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: OpenAI ↗
