Корпоративные системы безопасности AI, тратящие миллионы долларов на англоязычную настройку (alignment) и RLHF, создают иллюзию защиты. Реальность такова: модели, обученные на английском, имеют «слепые зоны» в латентном пространстве для других языков. Это позволяет злоумышленникам обходить фильтры, просто переводя вредоносные промпты на языки с низким ресурсом (low-resource languages) или используя тонкие форматированные директивы.
Механика уязвимости: от синтаксиса к геометрии
Нейросети не мыслят на конкретных языках; они оперируют в высокоразмерном непрерывном пространстве. Англоцентричная безопасность патчит только поверхностные синтаксические контуры. Глубокие семантические представления (например, концепции оружия или кибератак) остаются нескорректированными. Это приводит к тому, что модель может вежливо отказать на английском, но выдать вредоносный ответ на хауса или йоруба.
Ключевые метрики и риски
Исследование выделяет критические цифры, демонстрирующие масштаб проблемы:
- Риск для языков: Тонкая настройка на английском вредоносных данных непреднамеренно распространяет уязвимости на типологически разные языки, такие как хауса и йоруба.
- Эффективность атак: Бенечная активационная рулевая (activation steering) может повысить успех джейлбрейка с <1% до >80%.
- Архитектурная асимметрия: Шаловые слои трансформера учатся на токенах, но глубокое семантическое ядро остается общим для всех языков, что делает его уязвимым к кросс-лингвальным атакам.
Решение: Геометрическая безопасность
Простые фильтры промптов недостаточны. Авторы предлагают перейти к математически строгим геометрическим вмешательствам:
- LEACE (Least-squares Concept Erasure): Проекция небезопасных концепций в математическое нуль-пространство, чтобы физически «стереть» их из латентного представления.
- Fmxcoders (Factorized Masked Crosscoders): Отслеживание многоуровневых траекторий признаков для более глубокого контроля над активациями модели.
Без перехода от поверхностного поведенческого соответствия к латентной геометрической очистке, корпоративный AI останется уязвимым для «тихих» кросс-лингвальных взломов.
Источник: Towards AI pub ↗
