Проблема масштабирования SaP
Метод Safety as Polytope (SaP) ранее позволял обучать линейные ограничения в скрытом пространстве больших языковых моделей, но страдал от необходимости ручной настройки количества ограничений K для каждой категории. Это требовало исчерпывающих поисков по диапазону K=4–25 с случайной инициализацией, что замедляло внедрение.
Решение через SAE и «правило двух плоскостей»
Авторы (Fumiaki Uehara, Koo Imai и соавт.) показали, что извлечение признаков через разреженный автоэнкодер (Sparse Autoencoder, SAE) решает эту проблему. Оказалось, что K=2 становится оптимальным параметром для 12 из 14 категорий на модели Qwen3.5-9B. Это подтверждает Linear Representation Hypothesis: границы безопасности в пространстве SAE admit low-dimensional linear description (допускают низкоразмерное линейное описание).
Новый алгоритм: Cone Constraint
На основе геометрической перспективы введена коническая функция ограничения (cone constraint). Её обучаемый угол раскрытия адаптируется к концентрации кластеров каждой категории. Процесс стабилизирован с помощью трехфазного обучения (three-phase training), что исключает необходимость ручного тюнинга.
Результаты на BeaverTails
Метод демонстрирует высокую эффективность на бенчмарке BeaverTails, значительно превосходя подходы, требующие перебора гиперпараметров.
| Метрика / Параметр | Значение / Результат |
|---|---|
| Модель | Qwen3.5-9B |
| Оптимальное K (ограничения) | 2 (для 12/14 категорий) |
| Точность (Accuracy) | 96–99% per category |
| Бенчмарк | BeaverTails |
| Метод извлечения признаков | Sparse Autoencoder (SAE) |
Значение для индустрии
Результат доказывает, что безопасность LLM можно описывать простыми геометрическими объектами в пространстве SAE-признаков. Это упрощает интеграцию систем безопасности в производство, так как отпадает необходимость в ресурсоемком поиске оптимальной конфигурации ограничений для каждой новой модели или категории угроз.
Источник: arXiv cs.AI ↗
