Исследования11 августа 2026 г., 00:19 МСК🤖 Auto

Мультиязычный Троян: Англоцентричный AI-безопасность создает слепые зоны

Исследование показывает, что обучение моделей безопасности на английском языке оставляет глубокие уязвимости в латентном пространстве, позволяя обходить фильтры через перевод на другие языки.

Баннер новости 5473

Корпоративные системы безопасности AI, тратящие миллионы долларов на англоязычную настройку (alignment) и RLHF, создают иллюзию защиты. Реальность такова: модели, обученные на английском, имеют «слепые зоны» в латентном пространстве для других языков. Это позволяет злоумышленникам обходить фильтры, просто переводя вредоносные промпты на языки с низким ресурсом (low-resource languages) или используя тонкие форматированные директивы.

Механика уязвимости: от синтаксиса к геометрии

Нейросети не мыслят на конкретных языках; они оперируют в высокоразмерном непрерывном пространстве. Англоцентричная безопасность патчит только поверхностные синтаксические контуры. Глубокие семантические представления (например, концепции оружия или кибератак) остаются нескорректированными. Это приводит к тому, что модель может вежливо отказать на английском, но выдать вредоносный ответ на хауса или йоруба.

Ключевые метрики и риски

Исследование выделяет критические цифры, демонстрирующие масштаб проблемы:

  • Риск для языков: Тонкая настройка на английском вредоносных данных непреднамеренно распространяет уязвимости на типологически разные языки, такие как хауса и йоруба.
  • Эффективность атак: Бенечная активационная рулевая (activation steering) может повысить успех джейлбрейка с <1% до >80%.
  • Архитектурная асимметрия: Шаловые слои трансформера учатся на токенах, но глубокое семантическое ядро остается общим для всех языков, что делает его уязвимым к кросс-лингвальным атакам.

Решение: Геометрическая безопасность

Простые фильтры промптов недостаточны. Авторы предлагают перейти к математически строгим геометрическим вмешательствам:

  • LEACE (Least-squares Concept Erasure): Проекция небезопасных концепций в математическое нуль-пространство, чтобы физически «стереть» их из латентного представления.
  • Fmxcoders (Factorized Masked Crosscoders): Отслеживание многоуровневых траекторий признаков для более глубокого контроля над активациями модели.

Без перехода от поверхностного поведенческого соответствия к латентной геометрической очистке, корпоративный AI останется уязвимым для «тихих» кросс-лингвальных взломов.

Источник: Towards AI pub ↗