Исследования30 июня 2026 г., 17:17 МСК🤖 Auto

Turn-Averaged SAEs: Прорыв в интерпретируемости длинных контекстов

Исследователи из Redwood Research представили метод Turn-Averaged SAEs, который позволяет анализировать семантику целых диалоговых поворотов, решая проблему масштабирования sparse autoencoders.

Баннер новости 2576

Проблема линейного масштабирования

Стандартные Sparse Autoencoders (SAE) извлекают интерпретируемые признаки на уровне отдельных токенов. Это создает критическое ограничение: количество активных признаков растет линейно с длиной контекста. При работе с длинными транскриптами (long-context) это делает анализ непрактичным из-за вычислительной сложности и «шума» в данных.

Решение: Turn-Averaged SAEs

Авторы (Kevin Der, Harish Kamath, Ben Thompson) предлагают новую архитектуру, которая агрегирует активации модели в рамках одного «поворота» (turn) диалога — реплики пользователя или ассистента. Метод обучается реконструировать среднее значение активаций по всем токенам в рамках одного поворота, фиксируя количество признаков независимо от длины реплики.

Ключевые преимущества и метрики

Метод демонстрирует существенные улучшения в сравнении с токено-уровневыми подходами:

  • Качество описания: По оценке LLM, признаки Turn-Averaged полнее описывают высокоуровневые характеристики поворота, чем набор отдельных токенов.
  • Упрощение атрибуции: Метод радикально упрощает построение графов атрибуции (attribution graphs), делая их применимыми для длинных контекстов без экспоненциального роста сложности.
  • Практичность: Техника делает интерпретируемость (interpretability) реальной для моделей с длинным контекстом.

Значение для индустрии

Работа открывает путь к более глубокому пониманию того, как большие языковые модели обрабатывают сложные, многошаговые инструкции и длинные документы. Переход от токенов к семантическим блокам (поворотам) снижает шум и позволяет исследователям отслеживать «мыслительные цепочки» модели на макроуровне.

Источник: arXiv cs.CL ↗