Суть открытия: DecodeShare
Команда под руководством Зшана Шао (Zishan Shao) представила протокол DecodeShare, который позволяет идентифицировать и изолировать подпространство в скрытых состояниях (hidden states) больших языковых моделей. Это подпространство является общим для множества задач и активно используется именно на этапе декодирования (генерации токенов), а не во время префилла (анализа промпта).
Авторы доказали причинно-следственную связь: если искусственно «зашуметь» или удалить именно это общее подпространство во время генерации, производительность модели падает значительно сильнее, чем при воздействии на случайные векторы или подпространства, полученные на этапе префилла.
Метрика эффективности вмешательства
Ключевой вывод исследования заключается в том, что общее подпространство декодирования имеет высокую «плотность» функциональной информации. В таблице ниже приведены результаты сравнения влияния различных типов вмешательств на качество ответов модели при одинаковом бюджете вычислений:
| Тип вмешательства | Объект воздействия | Влияние на качество (деградация) | Вывод исследователей |
|---|---|---|---|
| DecodeShare (Shared Subspace) | Общее подпространство на этапе декодирования | Максимальная | Критический канал для принятия решений |
| Random Subspace | Случайные векторы в скрытых состояниях | Низкая | Слабая функциональная значимость |
| Prefill-derived Subspace | Подпространства, полученные на этапе префилла | Умеренная | Менее важно для генерации, чем декодирование |
Практическое применение: Steering Activation
Результаты DecodeShare имеют прямое отношение к технике activation steering (управление активациями), которая используется для тонкой настройки поведения моделей без дообучения. Исследователи обнаружили, что общие направления для управления поведением (steering directions) часто пересекаются с этим самым «общим каналом декодирования».
Это создает проблему: если мы пытаемся изменить поведение модели (например, сделать её более вежливой), мы можем случайно повредить её базовые способности к рассуждению. DecodeShare предлагает решение: проецирование (проецирование прочь) общего подпространства позволяет четко разделить функциональные роли префилла и декодирования.
Почему это важно для индустрии
1. Более надежный сигнал для деплоя. Оценка векторов управления на этапе декодирования дает более точный результат для конечного использования, чем использование прокси-данных с этапа префилла.
2. Эффективность вычислений. Несмотря на компактность (низкую размерность), это подпространство является «каналом с высоким рычагом» (high-leverage causal channel). Управление им позволяет влиять на поведение модели минимальными усилиями.
3. Прозрачность работы LLM. Исследование подтверждает существование структурированного, общего механизма принятия решений на этапе генерации, что открывает путь к более глубокому интерпретируемому анализу (Interpretability) нейросетей.
Код реализации протокола DecodeShare уже доступен в открытом доступе, что позволяет сообществу проверить результаты и интегрировать метод в свои пайплайны оптимизации LLM.
Источник: arXiv cs.AI ↗
