Проблема контекстной слепоты в безопасности LLM
Основная сложность защиты языковых моделей заключается в разграничении злонамеренных атак и невинных, но сформулированных неточно запросов. Существующие фреймворки безопасности часто применяют подход «контекстуального бандита» (contextual bandit), оценивая безопасность каждого запроса изолированно. Это игнорирует траекторию диалога, где злоумышленник может постепенно раскрывать свои истинные намерения в течение нескольких шагов (multi-turn dialogue), обходя статические правила фильтрации.
Решение: Dialogue Critic Guided Sampling (DCGS)
Авторы (Roman Belaire, Arunesh Sinha, Pradeep Varakantham) предлагают метод DCGS, который моделирует adversarial dialogue как процесс принятия решений Маркова (Markov Decision Process). Система обучает «критиков» (critics) на уровне отдельных токенов и целых реплик, оценивая ценность действий (action-value) на основе всей истории переписки. Вместо жестких правил DCGS вычисляет вероятные намерения пользователя и применяет reweighting во время инференса, что математически аппроксимирует экспоненциальное наклонение базовой политики (exponential tilting), гарантируя улучшение ожидаемого возврата (expected return).
Результаты бенчмарков
Методика DCGS демонстрирует превосходство над сильными базовыми моделями и frontier-решениями в задачах на устойчивость к диалоговым атакам. Ключевое преимущество — переносимость (transferability): фреймворк улучшает безопасность передовых моделей без необходимости их дообучения (fine-tuning). Ниже приведено сравнение эффективности на ключевых наборах данных:
| Набор данных | Описание | Результат DCGS |
|---|---|---|
| CARES-18k | Стандартный бенчмарк для оценки безопасности | Превосходство над базовыми моделями |
| WildJailbreak | Реалистичные сценарии обхода ограничений | Высокая устойчивость к многошаговым атакам |
| Redbench | Оценка вредоносного контента | Улучшенная фильтрация при сохранении полезности |
| Harmbench | Комплексная оценка рисков | Повышенная надежность без fine-tuning |
Значение для индустрии
Представленный подход решает фундаментальную проблему «двусмысленности намерений» в LLM. Способность системы адаптироваться к контексту диалога в реальном времени делает DCGS критически важным инструментом для разработчиков, стремящихся защитить свои модели от сложных, многоэтапных атак, не жертвуя при этом вычислительными ресурсами на переобучение базовых архитектур.
Источник: arXiv cs.AI ↗
