Масштаб проблемы: 50 исследований, 1500 кандидатов
Команда исследователей во главе с Валдини Дугласом Лемофуэтом провела систематический обзор (SLR) по методологии PRISMA 2020. Из примерно 1500 статей, найденных в Semantic Scholar, arXiv и OpenAlex, было отобрано 50 релевантных работ. Целью стало выявление причин, по которым гарантии безопасности LLM значительно слабее в мультиязычных и low-resource средах по сравнению с англоязычными.
Ключевые уязвимости: кросс-лингвальные джейлбрейки
Анализ выявил три основные категории угроз для моделей в языках с низким уровнем ресурсности:
- Кросс-лингвальные джейлбрейки (Jailbreaks): Атакующие используют разницу в уровнях защиты между языками, чтобы обойти фильтры безопасности.
- Атаки с переключением кодов (Code-switching): Комбинирование английского языка с low-resource языком в одном запросе для обхода детекции.
- Деградация безопасности: Снижение качества ответов и рост токсичности в языках, которые недостаточно представлены в обучающих данных.
Причины разрыва: от данных до архитектуры
Исследователи классифицировали подходы к выравниванию безопасности (safety alignment) по трем механизмам адаптации: адаптация данных, оптимизация целей и механистическое выравнивание. Однако текущие методы не справляются с задачей из-за:
- Неравномерного покрытия при мультиязычном предобучении.
- Недостатка данных предпочтений на родных языках (native-language preference data).
- Плохой переносимости представлений безопасности (safety representations) из английского в другие языки.
- Отсутствия культурно-ориентированных фреймворков оценки.
Таблица: Сравнение подходов к безопасности
| Механизм адаптации | Описание | Проблема в Low-Resource |
|---|---|---|
| Data Adaptation | Использование переведенных бенчмарков (часто с английского) | Не отражает культурно-специфичные угрозы |
| Objective Optimization | Настройка модели на предпочтениях (RLHF/DPO) | Нехватка качественных данных предпочтений на родных языках |
| Mechanistic Alignment | Прямое вмешательство в внутренние представления модели | Сложность переноса механизмов защиты между языковыми парами |
Региональный дисбаланс: Африка в зоне риска
Особое внимание уделено африканским языкам. Исследование показывает, что для многих африканских языков доступно значительно меньше бенчмарков безопасности, чем для других мультиязычных регионов. Это создает системное неравенство: пользователи этих языков сталкиваются с более высокими рисками генерации вредоносного или неэтичного контента.
Выводы и рекомендации
Авторы подчеркивают, что простое переводение английских тестов недостаточно. Для закрытия разрыва в безопасности необходимы:
- Культурно-обоснованные бенчмарки.
- Участие местных сообществ в сборе данных (participatory data collection).
- Сбалансированное мультиязычное предобучение.
- Масштабируемые методы мультиязычного выравнивания.
Источник: arXiv cs.CL ↗
