Исследования12 августа 2026 г., 11:16 МСК🤖 Auto

GFlowNets: Автогенерация атак на LLM для поиска уязвимостей

Исследователи представили метод автоматизированного red teaming на базе GFlowNets, превосходящий существующие бенчмарки по эффективности генерации антагонистических промптов.

Баннер новости 5594

Проблема статичных датасетов

Автоматизированное тестирование безопасности больших языковых моделей (LLM) традиционно опирается на фиксированные наборы данных атак. Этот подход ограничивает креативность: модели не могут генерировать новые, неочевидные векторы угроз, выходящие за рамки заранее заданных шаблонов. Ручной red teaming, напротив, эффективен, но требует значительных временных ресурсов и экспертизы.

Решение: GFlowNets для генерации атак

В работе "Generating Attacks for LLMs with GFlowNets" (авторы: Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali, Emin Islam Tatli) представлена архитектура, использующая GFlowNets (потоковые сети) для обучения модели-атакующего. Система работает по принципу «LLM против LLM»: одна модель генерирует промпты, а другая (жертва) пытается на них ответить. Цель — максимизировать вероятность того, что жертва нарушит правила безопасности.

Ключевые результаты и метрики

Метод демонстрирует высокую адаптивность, находя уязвимости, которые остаются незамеченными при использовании стандартных датасетов. Исследование подтверждает, что сгенерированные атаки на английском языке превосходят существующие бенчмарки по успешности обхода защитных механизмов.

Параметр Описание
Методология Использование GFlowNets для стохастической генерации последовательностей (промптов)
Языки Английский (основной бенчмарк), Турецкий (новое нововведение)
Преимущество Отсутствие зависимости от фиксированных датасетов, высокая вариативность атак
Результат Более эффективные adversarial-входы по сравнению с существующими методами

Новый вклад: Турецкий язык

Значимым нововведением статьи является адаптация модели для генерации атак на турецком языке. Это закрывает пробел в исследованиях безопасности LLM для низкоресурсных и специфических языковых сред, где стандартные англоязычные наборы тестов не применимы.

Значимость для индустрии

Предложенный подход позволяет компаниям получать количественные оценки устойчивости своих моделей. Вместо статичного сканирования, организации могут внедрять динамические системы red teaming, которые постоянно эволюционируют, находя новые способы обхода ограничений безопасности.

Источник: arXiv cs.AI ↗