Исследования6 августа 2026 г., 13:17 МСК🤖 Auto

Matryoshka NLAs: как заставить LLM говорить о главном в начале

Исследователи обучили активационные вербализаторы (NLA) на Qwen3.6-27B так, чтобы они помещали самую важную для реконструкции информацию в начало текста, используя метод случайного усечения.

Баннер новости 5205

Суть метода: «Матрешка» для объяснений

Стандартные Natural Language Autoencoders (NLA) генерируют связные тексты, где важность информации распределена неравномерно. Авторы предлагают подход Matryoshka NLA, вдохновленный концепцией Matryoshka Sparse Autoencoders. Ключевое отличие — во время обучения (RL) вывод активационного вербализатора (AV) случайно усечается до случайного количества токенов (от 1 до 120). Это заставляет модель «упаковывать» наиболее релевантную для реконструкции активации информацию в начало ответа, так как если текст обрывается, реконструктор (AR) все еще должен работать эффективно.

Технические детали и архитектура

Эксперимент проведен на модели Qwen3.6-27B (слой 42). Для обучения использовался фреймворк EasyNLA. Процесс включал следующие шаги:

  • Warm-start: 450k объяснений, сгенерированных Claude Sonnet 4.6, в формате 10 коротких буллитов. Это упрощает изоляцию отдельных утверждений по сравнению с абзацами.
  • RL-тренировка: 400 шагов RL. AV обучается генерировать объяснения, которые затем подаются в AR.
  • Усечение: В каждом GRPO-группе объяснение усечается до случайной длины. AR обучается работать с такими «обрывками».
  • KL-штраф: Штраф увеличен в 3 раза от базового EasyNLA, но экспоненциально снижается для поздних токенов. Это предотвращает доминирование штрафа над наградой за реконструкцию для «хвоста» текста.

Результаты: Маргинальная полезность токенов

Главное достижение — возможность измерять маргинальный FVE (Fraction of Variance Explained) для каждой строки или токена. В обычных NLA усечение выводит реконструктор из распределения, делая такой анализ невозможным. В Matryoshka NLA видно, что:

  • Большая часть объясняемой дисперсии захватывается в первых строках.
  • После третьей строки маргинальный прирост FVE падает почти до уровня шума.
  • Модель действительно учится ставить критически важные детали в начало, игнорируя «воду» в конце.

Сравнение с базовой моделью

Авторы сравнили производительность Matryoshka NLA со стандартным NLA, обученным на Qwen3.6-27B. Ниже приведены ключевые различия в поведении при усечении текста:

Характеристика Matryoshka NLA Стандартный NLA
Эффективность при усечении (до ~120 токенов) Выше (лучше реконструкция при коротких входах) Ниже
Эффективность при полном тексте Ниже (уступает полному стандартному NLA) Максимальная
Анализ маргинального FVE Возможен (информация упорядочена по важности) Затруднен (усечение — out-of-distribution)
Формат вывода Буллисты, легко изолировать утверждения Связные абзацы (3-5 блоков)

Наблюдения и ограничения

Исследование выявило несколько интересных феноменов. Во-первых, галлюцинации в объяснениях NLA не имеют статистически значимо меньшего маргинального FVE, чем правдивые утверждения — то есть «важность» для реконструкции не гарантирует истинности. Во-вторых, попытка обучить модель генерировать бесконечные списки (без жесткого лимита в 10 строк) пока не дала результатов: модель «застряла» на формате warm-start и генерируемые после 10-й строки пункты часто имеют отрицательный маргинальный FVE. Тем не менее, метод открывает путь к новым эвристикам для выявления салиентности признаков в нейросетях.

Источник: LessWrong ↗