Исследования18 августа 2026 г., 11:18 МСК🤖 Auto

LLM Safety Alignment in Low-Resource Languages: A Systematic Literature Review

Исследование выявило критический разрыв в безопасности LLM для языков с низким уровнем ресурсности (Low-Resource Languages). Анализ 50 работ показал, что модели уязвимы к кросс-лингвальным атакам и культурным искажениям.

Баннер новости 5981

Масштаб проблемы: 50 исследований, 1500 кандидатов

Команда исследователей во главе с Валдини Дугласом Лемофуэтом провела систематический обзор (SLR) по методологии PRISMA 2020. Из примерно 1500 статей, найденных в Semantic Scholar, arXiv и OpenAlex, было отобрано 50 релевантных работ. Целью стало выявление причин, по которым гарантии безопасности LLM значительно слабее в мультиязычных и low-resource средах по сравнению с англоязычными.

Ключевые уязвимости: кросс-лингвальные джейлбрейки

Анализ выявил три основные категории угроз для моделей в языках с низким уровнем ресурсности:

  • Кросс-лингвальные джейлбрейки (Jailbreaks): Атакующие используют разницу в уровнях защиты между языками, чтобы обойти фильтры безопасности.
  • Атаки с переключением кодов (Code-switching): Комбинирование английского языка с low-resource языком в одном запросе для обхода детекции.
  • Деградация безопасности: Снижение качества ответов и рост токсичности в языках, которые недостаточно представлены в обучающих данных.

Причины разрыва: от данных до архитектуры

Исследователи классифицировали подходы к выравниванию безопасности (safety alignment) по трем механизмам адаптации: адаптация данных, оптимизация целей и механистическое выравнивание. Однако текущие методы не справляются с задачей из-за:

  1. Неравномерного покрытия при мультиязычном предобучении.
  2. Недостатка данных предпочтений на родных языках (native-language preference data).
  3. Плохой переносимости представлений безопасности (safety representations) из английского в другие языки.
  4. Отсутствия культурно-ориентированных фреймворков оценки.

Таблица: Сравнение подходов к безопасности

Механизм адаптации Описание Проблема в Low-Resource
Data Adaptation Использование переведенных бенчмарков (часто с английского) Не отражает культурно-специфичные угрозы
Objective Optimization Настройка модели на предпочтениях (RLHF/DPO) Нехватка качественных данных предпочтений на родных языках
Mechanistic Alignment Прямое вмешательство в внутренние представления модели Сложность переноса механизмов защиты между языковыми парами

Региональный дисбаланс: Африка в зоне риска

Особое внимание уделено африканским языкам. Исследование показывает, что для многих африканских языков доступно значительно меньше бенчмарков безопасности, чем для других мультиязычных регионов. Это создает системное неравенство: пользователи этих языков сталкиваются с более высокими рисками генерации вредоносного или неэтичного контента.

Выводы и рекомендации

Авторы подчеркивают, что простое переводение английских тестов недостаточно. Для закрытия разрыва в безопасности необходимы:

  • Культурно-обоснованные бенчмарки.
  • Участие местных сообществ в сборе данных (participatory data collection).
  • Сбалансированное мультиязычное предобучение.
  • Масштабируемые методы мультиязычного выравнивания.

Источник: arXiv cs.CL ↗