Исследования18 июля 2026 г., 04:18 МСК🤖 Auto

LBA: Атака на LLM с минимумом запросов

Новый метод LBA решает проблему генерации текстовых атак с низким бюджетом запросов, превосходя существующие подходы по эффективности и сохранению смысла.

Баннер новости 3863

Проблема локального поиска

Генерация качественных текстовых примеров для атак (adversarial examples) в сценарии hard-label (когда модель выдает только дискретный класс, а не вероятности) остается сложной задачей. Большинство существующих методов используют жадные алгоритмы: они выбирают одну позицию в тексте для замены, затем другую. Такой локальный поиск часто не находит оптимальных решений и приводит к избыточным затратам запросов к модели. Идеальный вариант — учет всех комбинаций позиций, но полный перебор вычислительно невозможен.

Решение: LBA (Local-Bayesian Attack)

Авторы предлагают метод LBA, основанный на сэмплировании. Алгоритм строит аппроксимированное распределение высококачественных атак, интегрируя априорные (prior) и апостериорные (posterior) знания. По мере прогресса сэмплирования апостериорные знания обновляют распределение, что позволяет направлять поиск более эффективно. Это позволяет находить уязвимости быстрее, чем традиционные методы перебора.

Результаты экспериментов

Метод протестирован на шести языковых моделях (от малых до больших архитектур) и четырех наборах данных. LBA значительно превосходит базовые подходы (state-of-the-art baselines) по всем метрикам. Оценка с помощью LLM подтверждает, что сгенерированные тексты лучше сохраняют семантику и остаются читаемыми для человека.

Метрика / Характеристика Результат LBA Значение для безопасности
Бюджет запросов (Query Budget) Низкий (значительно меньше базовых методов) Позволяет проводить атаки в условиях ограниченного доступа к API
Качество атаки (Hard-Label) Превосходство над SOTA Высокая вероятность успешного обхода защиты
Семантическая сохранность Высокая (по оценке LLM) Атаки сложнее обнаружить по анормальности текста

Почему это важно

Результаты показывают, что даже при жестком ограничении на количество запросов к модели, злоумышленник может эффективно находить уязвимости. Это требует от разработчиков LLM пересмотра стратегий защиты, особенно в сценариях, где доступ к модели ограничен или тарифицируется. Метод LBA демонстрирует, что комбинирование априорных знаний с динамическим обновлением распределения — перспективный путь как для атак, так и для последующего улучшения устойчивости моделей.

Источник: arXiv cs.CL ↗