Суть исследования: учатся ли LoRA-адаптеры понимать контент?
Низкоранговая адаптация (LoRA) широко используется для дообучения больших моделей, однако вопрос о том, что именно представляют собой выученные параметры, остается малоизученным. Автор исследует, можно ли интерпретировать read directions (направления чтения) в LoRA как семантически осмысленные визуальные концепции. Эксперименты проведены на модели CLIP ViT-B/16 с дообучением на датасете ImageNet в течение 5 эпох.
Методология: как измеряется «понимание»
Для оценки семантической связности (semantic coherence) используется метрика Clarity. Она вычисляет среднюю косинусную схожесть между изображениями, активирующими конкретное направление. Высокий балл Clarity означает, что модель «видит» в этих изображениях общий смысл. Для сравнения результаты обученных направлений сопоставлялись с случайными (random) направлениями в residual stream модели CLIP.
Ключевые результаты: сравнение архитектур
Исследование сравнивает три типа адаптеров: Standard LoRA, ReLU LoRA и TopK LoRA. Результаты показывают, что обучение действительно повышает семантическую связность, но степень этой связности зависит от архитектуры:
| Тип LoRA | Ранг (Rank) | % направлений с высокой связностью | Особенности активации |
|---|---|---|---|
| Standard LoRA | 64 | 86% | Стабильная семантическая связность |
| ReLU LoRA | 64 | 95% | Наивысшая консистентность концепций |
| TopK LoRA | 3072 | 63% | Высокая вариативность; связные направления часто активируются редко |
Важный нюанс: случайность vs. обучение
Важнейший вывод статьи заключается в предостережении: одной лишь визуальной связности недостаточно для доказательства того, что направление представляет собой уникальный выученный концепт. Случайные направления также могут случайно генерировать высоко связные наборы изображений. Однако обученные направления (особенно в Standard и ReLU LoRA) демонстрируют значительно более высокую и стабильную связность по сравнению с базовой линией случайных векторов.
Вывод для разработчиков
LoRA-адаптеры, особенно с ReLU-активацией, эффективно выделяют семантически значимые паттерны в residual stream. Однако для TopK LoRA наблюдается большая «шумность»: хотя некоторые направления становятся очень четкими, они часто остаются неактивными для большинства входных данных. Это указывает на то, что интерпретируемость LoRA-адаптеров не является гарантированной и требует дополнительной верификации, а не только визуального анализа активаций.
Источник: LessWrong ↗
