Исследования29 июля 2026 г., 16:17 МСК🤖 Auto

Что на самом деле учат LoRA-адаптеры: анализ семантической связности

Исследование Zhao Pengfei показывает, что направления чтения (read directions) в LoRA-адаптерах действительно кодируют визуальные концепции, но с важными нюансами для разных архитектур.

Баннер новости 4637

Суть исследования: учатся ли LoRA-адаптеры понимать контент?

Низкоранговая адаптация (LoRA) широко используется для дообучения больших моделей, однако вопрос о том, что именно представляют собой выученные параметры, остается малоизученным. Автор исследует, можно ли интерпретировать read directions (направления чтения) в LoRA как семантически осмысленные визуальные концепции. Эксперименты проведены на модели CLIP ViT-B/16 с дообучением на датасете ImageNet в течение 5 эпох.

Методология: как измеряется «понимание»

Для оценки семантической связности (semantic coherence) используется метрика Clarity. Она вычисляет среднюю косинусную схожесть между изображениями, активирующими конкретное направление. Высокий балл Clarity означает, что модель «видит» в этих изображениях общий смысл. Для сравнения результаты обученных направлений сопоставлялись с случайными (random) направлениями в residual stream модели CLIP.

Ключевые результаты: сравнение архитектур

Исследование сравнивает три типа адаптеров: Standard LoRA, ReLU LoRA и TopK LoRA. Результаты показывают, что обучение действительно повышает семантическую связность, но степень этой связности зависит от архитектуры:

Тип LoRA Ранг (Rank) % направлений с высокой связностью Особенности активации
Standard LoRA 64 86% Стабильная семантическая связность
ReLU LoRA 64 95% Наивысшая консистентность концепций
TopK LoRA 3072 63% Высокая вариативность; связные направления часто активируются редко

Важный нюанс: случайность vs. обучение

Важнейший вывод статьи заключается в предостережении: одной лишь визуальной связности недостаточно для доказательства того, что направление представляет собой уникальный выученный концепт. Случайные направления также могут случайно генерировать высоко связные наборы изображений. Однако обученные направления (особенно в Standard и ReLU LoRA) демонстрируют значительно более высокую и стабильную связность по сравнению с базовой линией случайных векторов.

Вывод для разработчиков

LoRA-адаптеры, особенно с ReLU-активацией, эффективно выделяют семантически значимые паттерны в residual stream. Однако для TopK LoRA наблюдается большая «шумность»: хотя некоторые направления становятся очень четкими, они часто остаются неактивными для большинства входных данных. Это указывает на то, что интерпретируемость LoRA-адаптеров не является гарантированной и требует дополнительной верификации, а не только визуального анализа активаций.

Источник: LessWrong ↗