Проблема локального поиска
Генерация качественных текстовых примеров для атак (adversarial examples) в сценарии hard-label (когда модель выдает только дискретный класс, а не вероятности) остается сложной задачей. Большинство существующих методов используют жадные алгоритмы: они выбирают одну позицию в тексте для замены, затем другую. Такой локальный поиск часто не находит оптимальных решений и приводит к избыточным затратам запросов к модели. Идеальный вариант — учет всех комбинаций позиций, но полный перебор вычислительно невозможен.
Решение: LBA (Local-Bayesian Attack)
Авторы предлагают метод LBA, основанный на сэмплировании. Алгоритм строит аппроксимированное распределение высококачественных атак, интегрируя априорные (prior) и апостериорные (posterior) знания. По мере прогресса сэмплирования апостериорные знания обновляют распределение, что позволяет направлять поиск более эффективно. Это позволяет находить уязвимости быстрее, чем традиционные методы перебора.
Результаты экспериментов
Метод протестирован на шести языковых моделях (от малых до больших архитектур) и четырех наборах данных. LBA значительно превосходит базовые подходы (state-of-the-art baselines) по всем метрикам. Оценка с помощью LLM подтверждает, что сгенерированные тексты лучше сохраняют семантику и остаются читаемыми для человека.
| Метрика / Характеристика | Результат LBA | Значение для безопасности |
|---|---|---|
| Бюджет запросов (Query Budget) | Низкий (значительно меньше базовых методов) | Позволяет проводить атаки в условиях ограниченного доступа к API |
| Качество атаки (Hard-Label) | Превосходство над SOTA | Высокая вероятность успешного обхода защиты |
| Семантическая сохранность | Высокая (по оценке LLM) | Атаки сложнее обнаружить по анормальности текста |
Почему это важно
Результаты показывают, что даже при жестком ограничении на количество запросов к модели, злоумышленник может эффективно находить уязвимости. Это требует от разработчиков LLM пересмотра стратегий защиты, особенно в сценариях, где доступ к модели ограничен или тарифицируется. Метод LBA демонстрирует, что комбинирование априорных знаний с динамическим обновлением распределения — перспективный путь как для атак, так и для последующего улучшения устойчивости моделей.
Источник: arXiv cs.CL ↗
