Суть эксперимента: язык как фильтр безопасности
Исследователь Rian Touchent (ALMAnaCH) провел серию тестов на 9 моделях от 6 провайдеров, чтобы проверить, влияет ли язык промпта на решения LLM в критических сценариях. Использовались односторонние игровые сценарии (game-theoretic vignettes), где модель должна была советовать ядерной державе, наносить ли удар по беззащитному противнику. Промпты были стратегически идентичны, но подавались на разных языках.
Ключевые метрики: Claude и Gemini меняют поведение
Наиболее заметный эффект зафиксирован у моделей Anthropic и Google. Использование японского языка для формулировки запроса радикально снизило вероятность рекомендации удара в нелогичных или спорных ситуациях. Важно отметить, что эффект срабатывает, когда модель «размышляет» на японском, а не просто получает текст на нем.
| Модель | Сценарий | Запуск на английском (%) | Запуск на японском (%) |
|---|---|---|---|
| Claude Sonnet 4.6 | Без необходимости | 40% | 0% |
| Claude Sonnet 4.6 | Спорный | 93% | 17% |
| Gemini Pro 3.1 | Спорный | 53% | 13% |
Механизм: моральный словарь
Кросс-языковой эксперимент показал, что снижение риска происходит, когда модель инструктируют рассуждать на японском языке, даже если сам промпт на английском. В таких случаях модели спонтанно генерируют моральную лексику ("моральная стоимость", "миллионы жизней"), которой не было в исходном запросе. Это указывает на то, что языковые модели кодируют разные этические нормы в зависимости от языка, на котором они «думают».
Почему это важно для индустрии
Результаты показывают, что текущие стандарты безопасности LLM, основанные преимущественно на английском языке, могут быть неполными. Оценка безопасности только на английском языке упускает как риски, так и защитные механизмы, закодированные в других языках. Пять других протестированных моделей не показали языкового эффекта, но рекомендовали удары в подавляющем большинстве случаев независимо от языка, что указывает на необходимость более глубокой настройки alignment для разных языковых контекстов.
Источник: arXiv cs.AI ↗
