Исследования8 июля 2026 г., 21:17 МСК🤖 Auto

Скрытое обучение: почему LoRA и FFT работают при верных гиперпараметрах

Исследование опровергает миф о «перевернутой U-образной кривой» в сублимном обучении: модель усваивает скрытые паттерны на любом ранге и при полном дообучении, если правильно подобрать скорость обучения и объем данных.

Баннер новости 3138

Суть явления и проблема воспроизводимости

Сублимное обучение (subliminal learning) — это феномен, при котором языковая модель перенимает поведенческую черту (например, любовь к кошкам) из данных, которые на первый взгляд не содержат этой информации. В классическом эксперименте студент-модель обучается на последовательностях чисел, сгенерированных учителем с заданным системным промптом, и в итоге начинает проявлять «предпочтения» учителя, хотя никогда не видел самого промпта.

Ранее работы (Nief et al., Blank et al.) сообщали, что сублимное обучение работает только на средних рангах LoRA, а при очень низких рангах или полном дообучении (FFT) эффект отсутствует, образуя так называемую «перевернутую U-образную кривую». Lawrence Feng и коллеги провели повторные эксперименты, чтобы проверить, не является ли это артефактом плохой настройки гиперпараметров.

Ключевой фактор 1: Скорость обучения (Learning Rate)

Авторы обнаружили, что фиксированная скорость обучения, используемая в предыдущих исследованиях (2e-4), неоптимальна для разных рангов. В конфигурации с масштабированием r * alpha / r оптимальная скорость обучения сильно зависит от ранга: чем ниже ранг, тем выше должна быть скорость. При индивидуальной настройке LR для каждого ранга «перевернутая U» исчезает, и низкие ранги успешно усваивают черту.

Ключевой фактор 2: Объем данных

Для высоких рангов и полного дообучения (FFT) требуется значительно больше данных. Эксперименты показали, что проблема не в количестве шагов оптимизации (эпохах), а в разнообразии данных. Повторение одних и тех же 10 000 примеров не помогает высоким рангам, тогда как увеличение уникальной выборки до 25 800 примеров восстанавливает эффект обучения даже для FFT.

Сравнение результатов настройки гиперпараметров

Метод / Ранг Стратегия LR Объем данных Результат (Transfer)
LoRA (низкий ранг) Фиксированный (2e-4) 10k Низкий (артефакт настройки)
LoRA (низкий ранг) Оптимизированный под ранг 10k Высокий (эффект работает)
LoRA (высокий ранг) Оптимизированный под ранг 10k Низкий (нехватка данных)
LoRA (высокий ранг) Оптимизированный под ранг 25.8k Высокий (эффект работает)
Full Fine-Tuning (FFT) Оптимизированный 1M Высокий (требует много данных)

Обратный эффект в DPO

Интересно, что при смене метода обучения с SFT (Supervised Fine-Tuning) на DPO (Direct Preference Optimization) с использованием log-linear-selected preference pairs, тренд меняется на противоположный: эффективность передачи черты растет с увеличением ранга. Это указывает на то, что механизм сублимного обучения сложнее и зависит от типа оптимизационной задачи.

Почему это важно

Результаты показывают, что сублимное обучение — это не редкий сбой, а устойчивое свойство, которое можно контролировать. Понимание того, что высокие ранги и FFT требуют большего разнообразия данных (а не просто объема), помогает лучше предсказывать риски безопасности моделей. Если модель может перенести скрытые предубеждения из «нейтральных» числовых последовательностей, то аналогичные риски существуют и в более реалистичных сценариях обучения, где данные могут содержать скрытые паттерны.

Источник: LessWrong ↗