Исследования20 августа 2026 г., 07:21 МСК🤖 Auto

Иллюзия безопасности: LLM пропускают токсичность на индийских языках

Исследование arXiv:2608.18131 выявило критический разрыв в безопасности LLM: модели, защищенные от токсичности на английском, генерируют стереотипы на хинди, бенгали и тамильском.

Баннер новости 6136

Проблема англоцентричной защиты

Текущие методы alignment (согласования) больших языковых моделей (LLM) критически зависят от английского языка. Когда фильтры безопасности дают сбой на других языках, последствия становятся немедленными и видимыми для пользователя: голосовые помощники и системы диалога начинают воспроизводить вредные стереотипы, обходя стандартные англоязычные протоколы безопасности. Это представляет собой критический сбой для технологий, развернутых в лингвистически разнообразных регионах, таких как Индия.

Методология: бенчмарк INCLUDE

Для количественной оценки этого разрыва исследователи представили INCLUDE (Indian Cultural Lens for Understanding and Detecting Embedded Biases) — многоязычный бенчмарк, сфокусированный на социокультурных предубеждениях. В набор данных вошли 2 604 промпта, охватывающие шесть языков: английский, хинди, бенгали, маратхи, тамильский и хинглиш (смешанный хинди-английский). Всего было проанализировано 14 988 баллов предвзятости для десяти открытых и закрытых LLM.

Ключевые результаты: парадокс английского языка

Статистический анализ выявил два неожиданных факта. Во-первых, среди открытых моделей (open-source) наивысший средний балл предвзятости показал бенгали. Во-вторых, английский язык продемонстрировал аномалию: он имел наименьший уровень предвзятости в открытых моделях, но самый высокий — в закрытых (closed-source). Это указывает на то, что коммерческие модели могут быть более уязвимы к скрытым предубеждениям на доминирующем языке, чем их открытые аналоги.

Язык Открытые модели (Open-Source) Закрытые модели (Closed-Source) Примечание
Бенгали Наивысший балл предвзятости Критическая уязвимость открытых моделей
Английский Наименьший балл предвзятости Наивысший балл предвзятости Парадокс безопасности: закрытые модели хуже фильтруют английский
Хинди / Маратхи / Тамильский Средние значения Средние значения Требуют доработки фильтров

Почему это важно

Результаты исследования подчеркивают необходимость пересмотра подходов к безопасности ИИ. Опора исключительно на англоязычные датасеты для обучения защитных фильтров создает «иллюзию безопасности», которая рушится при масштабировании на глобальные рынки. Для разработчиков голосовых интерфейсов и сервисов в Южной Азии это означает, что текущие LLM не готовы к безопасному развертыванию без дополнительной локальной валидации и дообучения на культурно-специфичных данных.

Источник: arXiv cs.AI ↗