Разрушение мифа о безопасности не-английских языков
Распространенное заблуждение гласит, что использование языков, отличных от английского, в мультиязычных системах RAG (Retrieval-Augmented Generation) автоматически снижает риск утечки персональных данных (PII). Исследование Yanhang Li, Zhichao Fan и Zexin Zhuang, опубликованное в arXiv (2608.05163), опровергает это. Авторы провели аудит с использованием синтетического корпуса с PII, где все компоненты пайплайна — переводчик, судья (judge), обратный переводчик и генератор — были реализованы на модели Qwen2.5-7B.
Методология и ключевые метрики
Эксперимент охватил пять языков запросов. Система защиты состояла из двух этапов: проверка ввода через LLM и фильтрация вывода с помощью регулярных выражений (regex). Результаты показали, что при использовании только фильтрации вывода (output-only filtering) английский язык демонстрирует наивысший уровень утечки неструктурированных PII. Однако добавление этапа проверки ввода (input judge) не устранило проблему полностью: остаточные утечки сохранились для арабского и суахили.
| Язык запроса | Утечка PII (только фильтр вывода) | Утечка PII (с входным судьей) | Примечание |
|---|---|---|---|
| Английский | Наивысший уровень | Информация недостаточна | Чистое разделение с суахили по доверительным интервалам |
| Суахили | Ниже английского | Остаточные утечки | Обратный перевод не закрыл разрыв |
| Арабский | Информация недостаточна | Остаточные утечки | Обратный перевод не закрыл разрыв |
| Другие языки | Информация недостаточна | Информация недостаточна | Данные в полном тексте |
Диагностика механизма защиты
Авторы провели аблиционное исследование, показавшее, что обратный перевод запроса (back-translation) не устраняет разрыв в безопасности между языками. В отдельном тесте на 17 случаях остаточных утечек (multilingual-prompted-judge residual corner) прикрепление «золотого» документа к входному судье позволило заблокировать 15 из 17 случаев. Однако авторы подчеркивают, что это механизм диагностики, а не готовое решение: оно использует оракульный ретривинг, измеряет только ложноотрицательные результаты на адверсариальных запросах и не оценивает стоимость полезности ответа или ложноположительные срабатывания на легитимных запросах.
Ограничения и будущие шаги
Важно отметить, что все результаты являются условными для используемого пайплайна на базе Qwen2.5-7B и не являются причинно-следственным ранжированием языковых рисков. Исследование признает необходимость независимой репликации с использованием независимого машинного перевода, моделей, отличных от Qwen, и набора запросов от носителей языка. Код, корпуса и запросы доступны в дополнительных материалах статьи.
Источник: arXiv cs.CL ↗
