Суть эксперимента: Цепочка учителей и учеников
В отличие от классических исследований, где проверяется один шаг дистилляции, этот проект (BlueDot Impact) исследовал multi-hop subliminal learning — многоэтапное подсознательное обучение. Использовалась базовая модель Qwen2.5-7B-Instruct. Процесс выглядел так:
- Учитель 0 (T0): Базовая модель с системным промптом, задающим черту (например, «люблю кошек»).
- Ученик 1 (S1): Дообучается на 10 000 нейтральных последовательностей чисел, сгенерированных T0.
- Учитель 1 (T1): Становится S1. Генерирует новые данные для следующего шага.
- Цепочка: Процесс повторялся до 5-го шага (S5), где каждый предыдущий ученик становился учителем для следующего.
Исследовались два типа черт: «сильная» (кошки — хорошо передаются в Qwen) и «слабая» (совы — плохо передаются в Qwen, но хорошо в GPT). Вариировалось количество эпох обучения: 2 (короткое) и 6 (длинное). Оценка проводилась на 5000 ответов (50 вопросов × 100 вариантов).
Результат 1: Сильная черта стабилизируется при длительном обучении
Для черты «любовь к кошкам» (базовый уровень 4.0%) длительность обучения стала ключевым фактором стабильности. При 6 эпохах (ep6) выражение черты сохранялось и даже усиливалось, тогда как при 2 эпохах (ep2) результат был нестабильным и зависел от случайного семени (seed).
| Настройка | Базовый уровень (T0) | Конечный уровень (S5) | Стабильность |
|---|---|---|---|
| Cat-ep6 (6 эпох) | 92.7% | 84.4% – 96.0% | Высокая (низкая дисперсия) |
| Cat-ep2 (2 эпохи) | 92.7% | Seed 1: 61.8% Seed 2-3: < 10.0% |
Низкая (высокая зависимость от seed) |
Результат показывает, что для надежной передачи сильной черты через несколько звеньев цепочки необходимо достаточное количество эпох дообучения. Короткое обучение (ep2) приводит к хаотичному падению признака.
Результат 2: Слабая черта вызывает коллапс и феномен «Qwen»
Для черты «любовь к совам» (базовый уровень 0.0%) ситуация оказалась критической. После первого шага дистилляции выражение черты падало почти до нуля. Однако самое интересное наблюдение — появление ответов, содержащих имя модели.
В моделях, обучавшихся на «слабой» черте, доля ответов, начинающихся или содержащих слово «Qwen», резко возросла. Это указывает на коллапс способностей (capability collapse): модель перестает генерировать осмысленный контент по теме и начинает «зацикливаться» на своей идентификации или базовом паттерне.
| Настройка | Выражение черты (Совы) | Доля ответов «Qwen» | Интерпретация |
|---|---|---|---|
| Owl-ep6 | ~0.0% | > 50.0% (стабильно) | Модель «сломана»: не может выразить черту, доминирует авто-идентификация. |
| Owl-ep2 | Незначительные всплески | Снижается к S5 | Обратная корреляция: падение «Qwen» совпадает с небольшими всплесками черты. |
Результат 3: Механистические метрики не предсказывают выживание черты
Исследователи применили метрику EAS (Empirical Activation Similarity) — косинусное сходство между направлением активации учителя и ученика. Оказалось, что EAS не может надежно предсказать, выживет ли черта на следующем шаге (многоэтапное выживание).
Однако метрика отлично разделяет режимы обучения: все модели, обученные 6 эпох, стабильно находятся в одном кластере значений EAS, а модели с 2 эпохами — в другом. Это позволяет использовать механистические меры для диагностики качества процесса дистилляции, даже если они не прогнозируют конкретный семантический исход.
Почему это важно
Работа демонстрирует риски каскадной дистилляции в реальных пайплайнах. Если использовать модели, обученные на данных других моделей (особенно с короткими циклами дообучения), можно быстро потерять целевые свойства или получить «сломанные» модели, выдающие шаблонные ответы. Для безопасного использования LLM в цепочках важно контролировать не только семантическую точность, но и механистические индикаторы стабильности активаций.
Источник: LessWrong ↗
