Проблема масштабирования безопасности
OpenAI представила GPT-Red — специализированную модель для «красного командования» (red-teaming), созданную исключительно для безопасности. Главная причина разработки: человеческие тестировщики не справляются с масштабом. По мере того как агенты начинают читать сторонние данные через браузеры, приложения и локальные файлы, поверхность атак экспоненциально растет. Статические бенчмарки уже не работают, так как последние модели OpenAI их «сaturated» (насытили).
GPT-Red — это не библиотека промптов, а активный агент. Она отправляет запрос, анализирует ответ и итеративно улучшает атаку, подобно человеку. Модель обучена на вычислительной мощности крупнейших пост-тренировочных запусков, но строго изолирована от продакшена, чтобы злоумышленники не могли получить доступ к её вредоносным возможностям.
Механика обучения: Self-Play Reinforcement Learning
Ключевая инновация GPT-Red — обучение через саму игру (self-play RL). Атакующая модель (GPT-Red) и коллекция защитных LLM обучаются одновременно. Система вознаграждения устроена хитро:
- GPT-Red получает баллы за успешную инъекцию промпта.
- Защитник получает баллы только если он и отразил атаку, и успешно выполнил исходную задачу.
Это предотвращает ситуацию, когда защитник просто отказывается отвечать на любые запросы. Каждая среда имеет свою модель угроз, определяя, что именно контролирует атакующий (часть локального файла, баннер веб-страницы или вывод инструмента).
Результаты: GPT-Red против людей и моделей
В воспроизведенной арене косвенных инъекций промптов (indirect prompt injection arena) GPT-Red продемонстрировала подавляющее преимущество перед человеческими экспертами. Ниже приведены ключевые метрики эффективности:
| Сценарий / Цель | Результат GPT-Red | Результат Human Red-Teamers |
|---|---|---|
| Косвенные инъекции (GPT-5.1) | 84% успешных сценариев | 13% успешных сценариев |
| Прямые инъекции «Fake Chain-of-Thought» (GPT-5.1) | >95% успешных сценариев | — |
| Прямые инъекции «Fake Chain-of-Thought» (GPT-5.6 Sol) | <10% успешных сценариев | — |
| Прямые инъекции GPT-Red (GPT-5.6 Sol, новые среды) | 0.05% отказов модели | — |
Обучение на атаках GPT-Red позволило снизить количество сбоев на самых сложных бенчмарках для GPT-5.6 в 6 раз по сравнению с лучшей производственной моделью четырехмесячной давности.
Новый класс атак: Fake Chain-of-Thought
В процессе обучения GPT-Red обнаружила новый тип уязвимости, который исследователи OpenAI ранее не фиксировали. Атакующая модель внедряет поддельную запись в «цепочку размышлений» (chain-of-thought) целевой модели. Жертва верит, что эта информация была проверена, и действует на основе спуфинга. Этот метод оказался крайне эффективным против моделей серии GPT-5, но был успешно нейтрализован в GPT-5.6 Sol.
Реальные кейсы: от вендинговых автоматов до CLI
OpenAI протестировала GPT-Red на реальных агентах с неполным знанием их архитектуры:
- Vendy (AI-вендинговый автомат): GPT-Red смогла изменить цену дорогого товара на $0.50, заказать новый товар по этой цене и отменить заказ другого клиента. Уязвимости были сообщены, и сейчас тестируются исправления.
- Codex CLI agent: В тесте на эксфильтрацию данных (10 сценариев) GPT-Red оказалась эффективнее и токен-экономичнее, чем базовая модель GPT-5.5.
OpenAI подчеркивает, что GPT-Red не будет выпущена наружу. Однако она уже интегрирована в процесс разработки, помогая создавать более устойчивые модели. Тем не менее, компания признает, что многошаговые атаки и атаки на изображения по-прежнему требуют человеческого участия.
Источник: MarkTechPost ↗
