Суть исследования
Рохит Уппала (Rohith Uppala) представил первый системный аудит OpenAI Privacy Filter (OPF) — модели с 1.5 млрд параметров, предназначенной для обнаружения персонально идентифицируемой информации (PII). Тестирование охватило 42 синтетических набора данных, 22 языка и 5 предметных областей. Ключевой вывод: OPF выигрывает у открытых аналогов в англоязычных структурированных данных, но не справляется с культурной вариативностью и не-латинскими скриптами.
Сравнение с конкурентами
В задачах zero-shot OPF демонстрирует высокие результаты на бенчмарке AI4Privacy (F1=0.855), значительно превосходя Presidio (0.431) и XLM-RoBERTa (0.269). Однако в медицинской сфере (SPY) и мультиязычном NER лидируют другие решения. GPT-4o оказался универсальнее в сложных доменах (медицина, право, финансы), а XLM-RoBERTa доминирует на 13 индийских и не-латинских языках.
| Модель | AI4Privacy (F1) | SPY Medical (F1) | Сильные стороны |
|---|---|---|---|
| OpenAI Privacy Filter | 0.855 | 0.464 | Структурированный PII, поддержка |
| Presidio | 0.431 | 0.273 | — |
| XLM-RoBERTa | 0.269 | 0.111 | Мультиязычный NER (не-латиница) |
| GPT-4o | — | 0.643 (avg SPY) | Медицина, право, финансы |
Критические уязвимости
OPF теряет эффективность, когда PII скрыто в повествовательной прозе: F1 падает до 0.04–0.57. Для не-латинских скриптов модель практически бесполезна (F1=0.04 для арабского, 0.03 для кириллицы). Анализ ошибок выявил сильный перекос в сторону полноты (recall) в ущерб точности (precision) в медицинских и юридических текстах: Precision варьируется от 0.31 до 0.54 при Recall 0.70–0.85.
Что работает, а что нет
Модель отлично справляется с шаблонными данными: email (F1=0.78) и телефоны (F1=0.76). Слабые места — культурно-зависимые сущности: имена людей (F1=0.40) и адреса (F1=0.49). Для бизнеса это означает, что OPF подходит для фильтрации базовых контактов, но требует ручной валидации или гибридных систем для сложных сценариев и локальных рынков.
Источник: arXiv cs.CL ↗
