Исследования24 июля 2026 г., 10:16 МСК🤖 Auto

Robust Critics: Защита LLM от многошаговых атак через анализ намерений

Исследователи представили DCGS — фреймворк, использующий Markov Decision Process для оценки намерений пользователя в диалоге, что позволяет LLM эффективно противостоять многошаговым jailbreak-атакам без дообучения.

Баннер новости 4278

Проблема контекстной слепоты в безопасности LLM

Основная сложность защиты языковых моделей заключается в разграничении злонамеренных атак и невинных, но сформулированных неточно запросов. Существующие фреймворки безопасности часто применяют подход «контекстуального бандита» (contextual bandit), оценивая безопасность каждого запроса изолированно. Это игнорирует траекторию диалога, где злоумышленник может постепенно раскрывать свои истинные намерения в течение нескольких шагов (multi-turn dialogue), обходя статические правила фильтрации.

Решение: Dialogue Critic Guided Sampling (DCGS)

Авторы (Roman Belaire, Arunesh Sinha, Pradeep Varakantham) предлагают метод DCGS, который моделирует adversarial dialogue как процесс принятия решений Маркова (Markov Decision Process). Система обучает «критиков» (critics) на уровне отдельных токенов и целых реплик, оценивая ценность действий (action-value) на основе всей истории переписки. Вместо жестких правил DCGS вычисляет вероятные намерения пользователя и применяет reweighting во время инференса, что математически аппроксимирует экспоненциальное наклонение базовой политики (exponential tilting), гарантируя улучшение ожидаемого возврата (expected return).

Результаты бенчмарков

Методика DCGS демонстрирует превосходство над сильными базовыми моделями и frontier-решениями в задачах на устойчивость к диалоговым атакам. Ключевое преимущество — переносимость (transferability): фреймворк улучшает безопасность передовых моделей без необходимости их дообучения (fine-tuning). Ниже приведено сравнение эффективности на ключевых наборах данных:

Набор данных Описание Результат DCGS
CARES-18k Стандартный бенчмарк для оценки безопасности Превосходство над базовыми моделями
WildJailbreak Реалистичные сценарии обхода ограничений Высокая устойчивость к многошаговым атакам
Redbench Оценка вредоносного контента Улучшенная фильтрация при сохранении полезности
Harmbench Комплексная оценка рисков Повышенная надежность без fine-tuning

Значение для индустрии

Представленный подход решает фундаментальную проблему «двусмысленности намерений» в LLM. Способность системы адаптироваться к контексту диалога в реальном времени делает DCGS критически важным инструментом для разработчиков, стремящихся защитить свои модели от сложных, многоэтапных атак, не жертвуя при этом вычислительными ресурсами на переобучение базовых архитектур.

Источник: arXiv cs.AI ↗