Исследования23 июля 2026 г., 13:17 МСК🤖 Auto

SaP: Геометрия безопасности LLM. 99% точность на Qwen3.5-9B

Исследователи представили метод Geometry-Guided Constraint Learning, который использует разреженные автоэнкодеры (SAE) для выявления линейных границ безопасности в скрытых пространствах LLM, достигая 96–99% точности.

Баннер новости 4199

Проблема масштабирования SaP

Метод Safety as Polytope (SaP) ранее позволял обучать линейные ограничения в скрытом пространстве больших языковых моделей, но страдал от необходимости ручной настройки количества ограничений K для каждой категории. Это требовало исчерпывающих поисков по диапазону K=4–25 с случайной инициализацией, что замедляло внедрение.

Решение через SAE и «правило двух плоскостей»

Авторы (Fumiaki Uehara, Koo Imai и соавт.) показали, что извлечение признаков через разреженный автоэнкодер (Sparse Autoencoder, SAE) решает эту проблему. Оказалось, что K=2 становится оптимальным параметром для 12 из 14 категорий на модели Qwen3.5-9B. Это подтверждает Linear Representation Hypothesis: границы безопасности в пространстве SAE admit low-dimensional linear description (допускают низкоразмерное линейное описание).

Новый алгоритм: Cone Constraint

На основе геометрической перспективы введена коническая функция ограничения (cone constraint). Её обучаемый угол раскрытия адаптируется к концентрации кластеров каждой категории. Процесс стабилизирован с помощью трехфазного обучения (three-phase training), что исключает необходимость ручного тюнинга.

Результаты на BeaverTails

Метод демонстрирует высокую эффективность на бенчмарке BeaverTails, значительно превосходя подходы, требующие перебора гиперпараметров.

Метрика / Параметр Значение / Результат
Модель Qwen3.5-9B
Оптимальное K (ограничения) 2 (для 12/14 категорий)
Точность (Accuracy) 96–99% per category
Бенчмарк BeaverTails
Метод извлечения признаков Sparse Autoencoder (SAE)

Значение для индустрии

Результат доказывает, что безопасность LLM можно описывать простыми геометрическими объектами в пространстве SAE-признаков. Это упрощает интеграцию систем безопасности в производство, так как отпадает необходимость в ресурсоемком поиске оптимальной конфигурации ограничений для каждой новой модели или категории угроз.

Источник: arXiv cs.AI ↗