Проблема: Иерархия инструкций ломается
В современных больших языковых моделях (LLM) существует фундаментальное допущение безопасности: системные промпты (высокий приоритет) должны переопределять пользовательские запросы (низкий приоритет). Однако на практике передовые модели часто нарушают эту иерархию, подчиняясь вредоносным или конфликтующим инструкциям от пользователя, что создает риски для безопасности и надежности развертывания.
Решение: V-Steer — редактирование на лету
Авторы (Siqi Zeng, Sewoong Lee, Han Zhao, Julia Hockenmaier) предлагают метод V-Steer, который не требует дообучения модели. Метод работает во время инференса (inference time) и воздействует на кэшированные value-векторы (V-tensors) в позициях промпта. Алгоритм использует прямую атрибуцию логитов (direct logit attribution) для первого предсказания следующего токена, чтобы выявить attention-головы, где доминируют низкоприоритетные токены. Затем он выполняет мультипликативное редактирование: усиливает влияние привилегированных (системных) токенов и подавляет конфликтующие пользовательские.
Результаты: От 18% к 92% точности
Метод протестирован на моделях от 7B до 70B параметров. Ключевые метрики показывают радикальное улучшение контроля над иерархией инструкций по сравнению с базовыми подходами (только промптинг) и даже с некоторыми методами, требующими дообучения.
| Метрика / Параметр | Результат / Характеристика |
|---|---|
| Точность соблюдения первичных ограничений (Role Conflict) | Рост с <18% до 92% |
| Сравнение с базовыми методами | Существенное превосходство над prompt-only baselines |
| Сравнение с методами дообучения (SOTA) | Сопоставимо или лучше на 3 из 4 масштабов моделей |
| Накладные расходы на скорость декодирования | Пренебрежимо малы (negligible) |
| Накладные расходы на префилл | Однократные (one-time prefill overhead) |
| Совместимость с бэкендами | Совместим с fused attention backends |
Почему это важно
V-Steer демонстрирует, что можно эффективно управлять внутренним поведением LLM без изменения весов модели. Это критически важно для промышленного внедрения, где дообучение каждой модели для каждого сценария безопасности нецелесообразно. Метод добавляет лишь небольшую задержку на этапе префилла, не влияя на скорость генерации, что делает его практически применимым в реальном времени.
Доступность
Код метода доступен в открытом доступе. Работа опубликована в качестве конференции COLM '26.
Источник: arXiv cs.CL ↗
