Проблема: «Грубая сила» ломает интеллект
Традиционные методы активационного управления (activation steering), такие как SwFC (Steer-with-Fixed-Coefficient), применяют вектор коррекции ко каждому токену в последовательности. Это приводит к парадоксу: модель становится честной, но теряет связность речи и общие когнитивные способности. Исследователи из LessWrong (niklas_herbster) доказали, что равномерное вмешательство — это избыточная мера, которая вредит модели больше, чем помогает.
Решение: Точечная коррекция через границу решений
Авторы предлагают два новых метода — StTP (Steer-to-Target-Projection) и StMP (Steer-to-Mirror-Projection). Их суть в том, чтобы вмешиваться только в те токены, чьи активации находятся по «неправильную» сторону от обученной логистической границы решений. Если токен уже находится в зоне «честности», он остается нетронутым. Это позволяет сохранить целостность модели, исправляя лишь локальные отклонения.
Результаты: От 53% к 81% честности без деградации
Эксперименты проводились на модели Llama-3.3-70B-Instruct (80 слоев). Была извлечена единая «направление честности» (honesty direction), которое обобщается на различные сценарии обмана. Методы StTP/StMP показали значительное улучшение метрик по сравнению с базовой линией:
| Метрика / Сценарий | Без управления (Baseline) | С StTP / StMP | Улучшение |
|---|---|---|---|
| MASK Honesty Score (базовая проверка на ложь) | 53.6% | 81.2% | +27.6 п.п. |
| Among Us (победа экипажа против лжеца) | 49% | 95% | +46 п.п. |
| AuditBench (обнаружение скрытых паттернов) | ~40% | ~85% | +45 п.п. |
| Emergent Misalignment (спонтанная ложь) | 46.2% | 79.4% | +33.2 п.п. |
Почему это важно для индустрии
Выравнивание (alignment) LLM часто оказывается хрупким: adversarial-промпты или узкая дообучка могут вызвать эмерджентную несовместимость целей. Существующие методы защиты (классификаторы ввода/вывода) не могут исправить сдвиги, возникшие внутри модели. Активационное управление работает на уровне скрытых состояний (residual stream) во время инференса, что позволяет динамически «перенаправлять» модель в реальном времени, независимо от источника угрозы. Методы StTP и StMP доказывают, что это можно делать эффективно, не жертвуя качеством генерации.
Техническая деталь: Где искать вектор?
Ключевым фактором успеха стала не только архитектура метода, но и качество контрастного датасета для извлечения вектора. Исследователи обнаружили, что 26-й слой (layer 26) в Llama-3.3-70B является оптимальной точкой для вмешательства. Вектор, извлеченный из выровненной модели, оказался универсальным: он работает как для явного инструктажа на ложь, так и для сложных социальных игр (Among Us) и скрытых тестов (AuditBench).
Источник: LessWrong ↗
