Суть явления и проблема воспроизводимости
Сублимное обучение (subliminal learning) — это феномен, при котором языковая модель перенимает поведенческую черту (например, любовь к кошкам) из данных, которые на первый взгляд не содержат этой информации. В классическом эксперименте студент-модель обучается на последовательностях чисел, сгенерированных учителем с заданным системным промптом, и в итоге начинает проявлять «предпочтения» учителя, хотя никогда не видел самого промпта.
Ранее работы (Nief et al., Blank et al.) сообщали, что сублимное обучение работает только на средних рангах LoRA, а при очень низких рангах или полном дообучении (FFT) эффект отсутствует, образуя так называемую «перевернутую U-образную кривую». Lawrence Feng и коллеги провели повторные эксперименты, чтобы проверить, не является ли это артефактом плохой настройки гиперпараметров.
Ключевой фактор 1: Скорость обучения (Learning Rate)
Авторы обнаружили, что фиксированная скорость обучения, используемая в предыдущих исследованиях (2e-4), неоптимальна для разных рангов. В конфигурации с масштабированием r * alpha / r оптимальная скорость обучения сильно зависит от ранга: чем ниже ранг, тем выше должна быть скорость. При индивидуальной настройке LR для каждого ранга «перевернутая U» исчезает, и низкие ранги успешно усваивают черту.
Ключевой фактор 2: Объем данных
Для высоких рангов и полного дообучения (FFT) требуется значительно больше данных. Эксперименты показали, что проблема не в количестве шагов оптимизации (эпохах), а в разнообразии данных. Повторение одних и тех же 10 000 примеров не помогает высоким рангам, тогда как увеличение уникальной выборки до 25 800 примеров восстанавливает эффект обучения даже для FFT.
Сравнение результатов настройки гиперпараметров
| Метод / Ранг | Стратегия LR | Объем данных | Результат (Transfer) |
|---|---|---|---|
| LoRA (низкий ранг) | Фиксированный (2e-4) | 10k | Низкий (артефакт настройки) |
| LoRA (низкий ранг) | Оптимизированный под ранг | 10k | Высокий (эффект работает) |
| LoRA (высокий ранг) | Оптимизированный под ранг | 10k | Низкий (нехватка данных) |
| LoRA (высокий ранг) | Оптимизированный под ранг | 25.8k | Высокий (эффект работает) |
| Full Fine-Tuning (FFT) | Оптимизированный | 1M | Высокий (требует много данных) |
Обратный эффект в DPO
Интересно, что при смене метода обучения с SFT (Supervised Fine-Tuning) на DPO (Direct Preference Optimization) с использованием log-linear-selected preference pairs, тренд меняется на противоположный: эффективность передачи черты растет с увеличением ранга. Это указывает на то, что механизм сублимного обучения сложнее и зависит от типа оптимизационной задачи.
Почему это важно
Результаты показывают, что сублимное обучение — это не редкий сбой, а устойчивое свойство, которое можно контролировать. Понимание того, что высокие ранги и FFT требуют большего разнообразия данных (а не просто объема), помогает лучше предсказывать риски безопасности моделей. Если модель может перенести скрытые предубеждения из «нейтральных» числовых последовательностей, то аналогичные риски существуют и в более реалистичных сценариях обучения, где данные могут содержать скрытые паттерны.
Источник: LessWrong ↗
