Исследования8 августа 2026 г., 03:17 МСК🤖 Auto

Аудит утечек PII в RAG: почему английский опаснее других языков

Исследование Qwen2.5-7B в мультиязычном RAG показало, что английский язык имеет самый высокий уровень утечки персональных данных, а защита требует комбинированного подхода.

Баннер новости 5347

Разрушение мифа о безопасности не-английских языков

Распространенное заблуждение гласит, что использование языков, отличных от английского, в мультиязычных системах RAG (Retrieval-Augmented Generation) автоматически снижает риск утечки персональных данных (PII). Исследование Yanhang Li, Zhichao Fan и Zexin Zhuang, опубликованное в arXiv (2608.05163), опровергает это. Авторы провели аудит с использованием синтетического корпуса с PII, где все компоненты пайплайна — переводчик, судья (judge), обратный переводчик и генератор — были реализованы на модели Qwen2.5-7B.

Методология и ключевые метрики

Эксперимент охватил пять языков запросов. Система защиты состояла из двух этапов: проверка ввода через LLM и фильтрация вывода с помощью регулярных выражений (regex). Результаты показали, что при использовании только фильтрации вывода (output-only filtering) английский язык демонстрирует наивысший уровень утечки неструктурированных PII. Однако добавление этапа проверки ввода (input judge) не устранило проблему полностью: остаточные утечки сохранились для арабского и суахили.

Язык запроса Утечка PII (только фильтр вывода) Утечка PII (с входным судьей) Примечание
Английский Наивысший уровень Информация недостаточна Чистое разделение с суахили по доверительным интервалам
Суахили Ниже английского Остаточные утечки Обратный перевод не закрыл разрыв
Арабский Информация недостаточна Остаточные утечки Обратный перевод не закрыл разрыв
Другие языки Информация недостаточна Информация недостаточна Данные в полном тексте

Диагностика механизма защиты

Авторы провели аблиционное исследование, показавшее, что обратный перевод запроса (back-translation) не устраняет разрыв в безопасности между языками. В отдельном тесте на 17 случаях остаточных утечек (multilingual-prompted-judge residual corner) прикрепление «золотого» документа к входному судье позволило заблокировать 15 из 17 случаев. Однако авторы подчеркивают, что это механизм диагностики, а не готовое решение: оно использует оракульный ретривинг, измеряет только ложноотрицательные результаты на адверсариальных запросах и не оценивает стоимость полезности ответа или ложноположительные срабатывания на легитимных запросах.

Ограничения и будущие шаги

Важно отметить, что все результаты являются условными для используемого пайплайна на базе Qwen2.5-7B и не являются причинно-следственным ранжированием языковых рисков. Исследование признает необходимость независимой репликации с использованием независимого машинного перевода, моделей, отличных от Qwen, и набора запросов от носителей языка. Код, корпуса и запросы доступны в дополнительных материалах статьи.

Источник: arXiv cs.CL ↗