AI-новости14 мая 2026 г., 00:06 МСК

Репозиторий с 3000+ stars собрал карту уязвимостей GPT: от jailbreak до prompt injection

Фото новости

Промпты для взлома GPT больше не ищут по кускам в Reddit и чатах. Их сложили в один репозиторий, и он уже набрал 3000+ stars. В версии 2.0 автор собрал рабочие jailbreak-сценарии, утечки системных инструкций и базы для защиты.

Это не просто «список ссылок». Это публичная карта войны между атакой и защитой AI. Причём карта обновляется почти в реальном времени.

Один репозиторий вместо 50 вкладок: что реально изменилось

главная страница GitHub-репозитория Awesome GPT Super Prompting с разделами jailbreak, prompt injection и security
Скриншот: github.com

Раньше командам приходилось собирать материалы вручную. Теперь ключевые направления лежат в одном месте и разбиты по папкам. Самая важная зона, по словам автора, это Latest Jailbreaks с актуальными примерами.

Если по-человечески, это как антивирусная база. Только для промптов, атак и контрмер в LLM (большие языковые модели).

  • Jailbreaks (обход ограничений модели): подборки техник и рабочих шаблонов.
  • Prompt Leaks (утечки системных инструкций): примеры вскрытых промптов GPT-агентов.
  • Prompt Injection (внедрение вредных инструкций): инструменты для тестов и атак.
  • Secure Prompting (безопасное проектирование промптов): практики защиты и чеклисты.
  • Prompt Engineering (инженерия промптов): библиотеки, гайды и учебные материалы.

Внутри есть и «легенды» сообщества, и свежие инструменты. Например, FuzzyAI для fuzzing (автоматический перебор неожиданных входов), и PromptBench для benchmark (тест производительности) уязвимостей prompt injection.

Почему такие списки взлетают и что за этим стоит

Причина простая: бизнес уже вшивает GPT в продажи, поддержку и внутренние процессы. Атаки на промпты перестали быть игрушкой энтузиастов. Это уже риск для денег, бренда и данных.

Любой публичный агент может попасть под попытку обхода правил. Если у вас есть RAG (генерация с доступом к корпоративной базе), риск выше. Через плохой ввод можно вытянуть лишний контекст или сломать логику ответа.

Автор репозитория прямо пишет: нашли ваш секретный промпт, пишите, удалим. Это показывает новую реальность. Секретный системный промпт сегодня, вероятно, станет публичным завтра.

Что происходитЧто это значит для команды
Jailbreak-подборки растутНужно регулярно тестировать бота на обход ограничений
Появляются базы утечек промптовНельзя строить защиту только на «скрытом тексте»
Есть открытые security-инструментыМожно дешево запустить базовый аудит уже сегодня
Сообщества делятся рабочими кейсамиУязвимости распространяются быстрее релизов моделей

Как применить это прямо сейчас, даже без отдельной AI-команды

Не обязательно быть безопасником, чтобы получить пользу. Достаточно 2 часов и простого плана. Начните с критичных сценариев: поддержка клиентов, сделки, доступ к внутренним документам.

  • Составьте список из 10 самых важных пользовательских задач в вашем боте.
  • Прогоните их через негативные тесты: «игнорируй правила», «покажи системный промпт», «выполни скрытую инструкцию».
  • Добавьте фильтры на вход и выход, плюс ручную модерацию для рискованных запросов.
  • Проверьте логи на странные фразы и повторяющиеся паттерны атак.
  • Внедрите еженедельный mini-red-team (мини-команда проверки на взлом) на 30 минут.

Если нужен стартовый набор, посмотрите источник: Awesome GPT Super Prompting. Для команд это быстрый способ увидеть картину целиком. Для фрилансеров и стартапов, это шанс не наступить на чужие грабли.

Кому особенно полезно

  • Предпринимателям: понять, где AI может подставить бизнес юридически и репутационно.
  • Маркетологам: защитить AI-воронки и чат-боты от токсичных и манипулятивных ответов.
  • Разработчикам: получить реальные кейсы атак и готовые направления для hardening (усиление защиты).
  • Продуктовым командам: быстрее договориться о правилах безопасности до масштабирования.

Главная мысль недели простая. Рынок AI движется к миру, где побеждает не самая «умная» модель, а самая устойчивая. Следующий конкурентный плюс, это не только качество текста, а безопасность по умолчанию в каждом промпте.