Проблема линейного масштабирования
Стандартные Sparse Autoencoders (SAE) извлекают интерпретируемые признаки на уровне отдельных токенов. Это создает критическое ограничение: количество активных признаков растет линейно с длиной контекста. При работе с длинными транскриптами (long-context) это делает анализ непрактичным из-за вычислительной сложности и «шума» в данных.
Решение: Turn-Averaged SAEs
Авторы (Kevin Der, Harish Kamath, Ben Thompson) предлагают новую архитектуру, которая агрегирует активации модели в рамках одного «поворота» (turn) диалога — реплики пользователя или ассистента. Метод обучается реконструировать среднее значение активаций по всем токенам в рамках одного поворота, фиксируя количество признаков независимо от длины реплики.
Ключевые преимущества и метрики
Метод демонстрирует существенные улучшения в сравнении с токено-уровневыми подходами:
- Качество описания: По оценке LLM, признаки Turn-Averaged полнее описывают высокоуровневые характеристики поворота, чем набор отдельных токенов.
- Упрощение атрибуции: Метод радикально упрощает построение графов атрибуции (attribution graphs), делая их применимыми для длинных контекстов без экспоненциального роста сложности.
- Практичность: Техника делает интерпретируемость (interpretability) реальной для моделей с длинным контекстом.
Значение для индустрии
Работа открывает путь к более глубокому пониманию того, как большие языковые модели обрабатывают сложные, многошаговые инструкции и длинные документы. Переход от токенов к семантическим блокам (поворотам) снижает шум и позволяет исследователям отслеживать «мыслительные цепочки» модели на макроуровне.
Источник: arXiv cs.CL ↗
