Суть метода: «Матрешка» для объяснений
Стандартные Natural Language Autoencoders (NLA) генерируют связные тексты, где важность информации распределена неравномерно. Авторы предлагают подход Matryoshka NLA, вдохновленный концепцией Matryoshka Sparse Autoencoders. Ключевое отличие — во время обучения (RL) вывод активационного вербализатора (AV) случайно усечается до случайного количества токенов (от 1 до 120). Это заставляет модель «упаковывать» наиболее релевантную для реконструкции активации информацию в начало ответа, так как если текст обрывается, реконструктор (AR) все еще должен работать эффективно.
Технические детали и архитектура
Эксперимент проведен на модели Qwen3.6-27B (слой 42). Для обучения использовался фреймворк EasyNLA. Процесс включал следующие шаги:
- Warm-start: 450k объяснений, сгенерированных Claude Sonnet 4.6, в формате 10 коротких буллитов. Это упрощает изоляцию отдельных утверждений по сравнению с абзацами.
- RL-тренировка: 400 шагов RL. AV обучается генерировать объяснения, которые затем подаются в AR.
- Усечение: В каждом GRPO-группе объяснение усечается до случайной длины. AR обучается работать с такими «обрывками».
- KL-штраф: Штраф увеличен в 3 раза от базового EasyNLA, но экспоненциально снижается для поздних токенов. Это предотвращает доминирование штрафа над наградой за реконструкцию для «хвоста» текста.
Результаты: Маргинальная полезность токенов
Главное достижение — возможность измерять маргинальный FVE (Fraction of Variance Explained) для каждой строки или токена. В обычных NLA усечение выводит реконструктор из распределения, делая такой анализ невозможным. В Matryoshka NLA видно, что:
- Большая часть объясняемой дисперсии захватывается в первых строках.
- После третьей строки маргинальный прирост FVE падает почти до уровня шума.
- Модель действительно учится ставить критически важные детали в начало, игнорируя «воду» в конце.
Сравнение с базовой моделью
Авторы сравнили производительность Matryoshka NLA со стандартным NLA, обученным на Qwen3.6-27B. Ниже приведены ключевые различия в поведении при усечении текста:
| Характеристика | Matryoshka NLA | Стандартный NLA |
|---|---|---|
| Эффективность при усечении (до ~120 токенов) | Выше (лучше реконструкция при коротких входах) | Ниже |
| Эффективность при полном тексте | Ниже (уступает полному стандартному NLA) | Максимальная |
| Анализ маргинального FVE | Возможен (информация упорядочена по важности) | Затруднен (усечение — out-of-distribution) |
| Формат вывода | Буллисты, легко изолировать утверждения | Связные абзацы (3-5 блоков) |
Наблюдения и ограничения
Исследование выявило несколько интересных феноменов. Во-первых, галлюцинации в объяснениях NLA не имеют статистически значимо меньшего маргинального FVE, чем правдивые утверждения — то есть «важность» для реконструкции не гарантирует истинности. Во-вторых, попытка обучить модель генерировать бесконечные списки (без жесткого лимита в 10 строк) пока не дала результатов: модель «застряла» на формате warm-start и генерируемые после 10-й строки пункты часто имеют отрицательный маргинальный FVE. Тем не менее, метод открывает путь к новым эвристикам для выявления салиентности признаков в нейросетях.
Источник: LessWrong ↗
