Проблема англоцентричной защиты
Текущие методы alignment (согласования) больших языковых моделей (LLM) критически зависят от английского языка. Когда фильтры безопасности дают сбой на других языках, последствия становятся немедленными и видимыми для пользователя: голосовые помощники и системы диалога начинают воспроизводить вредные стереотипы, обходя стандартные англоязычные протоколы безопасности. Это представляет собой критический сбой для технологий, развернутых в лингвистически разнообразных регионах, таких как Индия.
Методология: бенчмарк INCLUDE
Для количественной оценки этого разрыва исследователи представили INCLUDE (Indian Cultural Lens for Understanding and Detecting Embedded Biases) — многоязычный бенчмарк, сфокусированный на социокультурных предубеждениях. В набор данных вошли 2 604 промпта, охватывающие шесть языков: английский, хинди, бенгали, маратхи, тамильский и хинглиш (смешанный хинди-английский). Всего было проанализировано 14 988 баллов предвзятости для десяти открытых и закрытых LLM.
Ключевые результаты: парадокс английского языка
Статистический анализ выявил два неожиданных факта. Во-первых, среди открытых моделей (open-source) наивысший средний балл предвзятости показал бенгали. Во-вторых, английский язык продемонстрировал аномалию: он имел наименьший уровень предвзятости в открытых моделях, но самый высокий — в закрытых (closed-source). Это указывает на то, что коммерческие модели могут быть более уязвимы к скрытым предубеждениям на доминирующем языке, чем их открытые аналоги.
| Язык | Открытые модели (Open-Source) | Закрытые модели (Closed-Source) | Примечание |
|---|---|---|---|
| Бенгали | Наивысший балл предвзятости | — | Критическая уязвимость открытых моделей |
| Английский | Наименьший балл предвзятости | Наивысший балл предвзятости | Парадокс безопасности: закрытые модели хуже фильтруют английский |
| Хинди / Маратхи / Тамильский | Средние значения | Средние значения | Требуют доработки фильтров |
Почему это важно
Результаты исследования подчеркивают необходимость пересмотра подходов к безопасности ИИ. Опора исключительно на англоязычные датасеты для обучения защитных фильтров создает «иллюзию безопасности», которая рушится при масштабировании на глобальные рынки. Для разработчиков голосовых интерфейсов и сервисов в Южной Азии это означает, что текущие LLM не готовы к безопасному развертыванию без дополнительной локальной валидации и дообучения на культурно-специфичных данных.
Источник: arXiv cs.AI ↗
