Исследования17 сентября 2026 г., 04:17 МСК🤖 Auto

Многоэтапное подсознательное обучение: как Qwen2.5 теряет способность или усиливает черты

Исследование Arnel Malubay показало, что при цепочечной дистилляции Qwen2.5-7B сильные черты (любовь к кошкам) стабилизируются при длительном обучении, а слабые (совы) приводят к коллапсу способностей и появлению ответов «Qwen».

Баннер новости 7677

Суть эксперимента: Цепочка учителей и учеников

В отличие от классических исследований, где проверяется один шаг дистилляции, этот проект (BlueDot Impact) исследовал multi-hop subliminal learning — многоэтапное подсознательное обучение. Использовалась базовая модель Qwen2.5-7B-Instruct. Процесс выглядел так:

  • Учитель 0 (T0): Базовая модель с системным промптом, задающим черту (например, «люблю кошек»).
  • Ученик 1 (S1): Дообучается на 10 000 нейтральных последовательностей чисел, сгенерированных T0.
  • Учитель 1 (T1): Становится S1. Генерирует новые данные для следующего шага.
  • Цепочка: Процесс повторялся до 5-го шага (S5), где каждый предыдущий ученик становился учителем для следующего.

Исследовались два типа черт: «сильная» (кошки — хорошо передаются в Qwen) и «слабая» (совы — плохо передаются в Qwen, но хорошо в GPT). Вариировалось количество эпох обучения: 2 (короткое) и 6 (длинное). Оценка проводилась на 5000 ответов (50 вопросов × 100 вариантов).

Результат 1: Сильная черта стабилизируется при длительном обучении

Для черты «любовь к кошкам» (базовый уровень 4.0%) длительность обучения стала ключевым фактором стабильности. При 6 эпохах (ep6) выражение черты сохранялось и даже усиливалось, тогда как при 2 эпохах (ep2) результат был нестабильным и зависел от случайного семени (seed).

Настройка Базовый уровень (T0) Конечный уровень (S5) Стабильность
Cat-ep6 (6 эпох) 92.7% 84.4% – 96.0% Высокая (низкая дисперсия)
Cat-ep2 (2 эпохи) 92.7% Seed 1: 61.8%
Seed 2-3: < 10.0%
Низкая (высокая зависимость от seed)

Результат показывает, что для надежной передачи сильной черты через несколько звеньев цепочки необходимо достаточное количество эпох дообучения. Короткое обучение (ep2) приводит к хаотичному падению признака.

Результат 2: Слабая черта вызывает коллапс и феномен «Qwen»

Для черты «любовь к совам» (базовый уровень 0.0%) ситуация оказалась критической. После первого шага дистилляции выражение черты падало почти до нуля. Однако самое интересное наблюдение — появление ответов, содержащих имя модели.

В моделях, обучавшихся на «слабой» черте, доля ответов, начинающихся или содержащих слово «Qwen», резко возросла. Это указывает на коллапс способностей (capability collapse): модель перестает генерировать осмысленный контент по теме и начинает «зацикливаться» на своей идентификации или базовом паттерне.

Настройка Выражение черты (Совы) Доля ответов «Qwen» Интерпретация
Owl-ep6 ~0.0% > 50.0% (стабильно) Модель «сломана»: не может выразить черту, доминирует авто-идентификация.
Owl-ep2 Незначительные всплески Снижается к S5 Обратная корреляция: падение «Qwen» совпадает с небольшими всплесками черты.

Результат 3: Механистические метрики не предсказывают выживание черты

Исследователи применили метрику EAS (Empirical Activation Similarity) — косинусное сходство между направлением активации учителя и ученика. Оказалось, что EAS не может надежно предсказать, выживет ли черта на следующем шаге (многоэтапное выживание).

Однако метрика отлично разделяет режимы обучения: все модели, обученные 6 эпох, стабильно находятся в одном кластере значений EAS, а модели с 2 эпохами — в другом. Это позволяет использовать механистические меры для диагностики качества процесса дистилляции, даже если они не прогнозируют конкретный семантический исход.

Почему это важно

Работа демонстрирует риски каскадной дистилляции в реальных пайплайнах. Если использовать модели, обученные на данных других моделей (особенно с короткими циклами дообучения), можно быстро потерять целевые свойства или получить «сломанные» модели, выдающие шаблонные ответы. Для безопасного использования LLM в цепочках важно контролировать не только семантическую точность, но и механистические индикаторы стабильности активаций.

Источник: LessWrong ↗