Суть проблемы: эффект мозаики
Исследователи из ServiceNow (Alexander Gurung, Rafael Pardinas) выявили критический уязвимость в работе современных AI-агентов для глубокого анализа (deep research). Агенты часто комбинируют локальные корпоративные документы с внешними веб-поисками. Хотя каждый отдельный запрос может выглядеть безобидно, их совокупность позволяет злоумышленнику восстановить секретную информацию. Этот феномен назван «эффектом мозаики» (mosaic effect).
Пример: агент ищет информацию о миграции в облако. Запросы «MediConn», «70%», «январь 2024» по отдельности ничего не значат, но вместе они раскрывают, что MediConn перенесла 70% инфраструктуры в облако к январю 2025 года — факт, содержащийся только во внутренних документах.
Три уровня утечек
Авторы классифицируют риски на основе того, что может вывести злоумышленник из лога запросов:
- Intent leakage (Утечка намерений): Восстановление целей исследования или частных вопросов.
- Answer leakage (Утечка ответов): Возможность ответить на конкретный вопрос о приватных данных, не видя самих документов.
- Full-information leakage (Полная утечка информации): Самая опасная категория. Наблюдатель может верифицируемо утверждать частные факты, даже не зная заранее, что именно искать.
Результаты тестирования: обучение ухудшило приватность
Команда протестировала агентов на наборе данных MosaicLeaks (1001 многошаговая цепочка). Оказалось, что стандартное обучение только на точность выполнения задачи парадоксальным образом усиливает утечки. Модель учится «упаковывать» больше контекста в запросы для лучшего поиска, что облегчает реконструкцию данных.
| Метрика | Базовая модель | После обучения на точность | С методом PA-DR |
|---|---|---|---|
| Strict Chain Success (Успешность цепочки) | 48.7% | 59.3% | 58.7% |
| Answer/Full-info Leakage (Утечка данных) | 34.0% | 51.7% | 9.9% |
Простое добавление инструкции в промпт (prompt engineering) дало лишь незначительное снижение утечек (до 25.5% для Qwen3-4B) за счет сокращения числа запросов, но снизило и качество выполнения задач.
Решение: Privacy-Aware Deep Research (PA-DR)
Для решения конфликта между точностью и приватностью ServiceNow предложили метод обучения с подкреплением PA-DR. Он использует два типа вознаграждений:
- Ситуационная награда за задачу: Оценка каждого шага (Plan, Choose, Read, Resolve) относительно других шагов на том же этапе, а не только финального результата.
- Награда за приватность: Штрафы за генерацию запросов, содержащих слишком много специфичных частных сущностей.
Результат: PA-DR удалось снизить уровень утечки информации с 34.0% до 9.9%, сохранив при этом высокий уровень успешного выполнения исследовательских цепочек (58.7%).
Почему это важно
По мере внедрения AI-агентов в корпоративную среду (особенно в здравоохранении, финансах и юриспруденции), проблема безопасности выходит за рамки защиты самих баз данных. Логи внешних запросов становятся новым вектором атаки. MosaicLeaks демонстрирует, что безопасность должна закладываться на этапе обучения модели (RLHF/RLAIF), а не просто добавляться через промпты.
Источник: Hugging Face blog ↗
