Проблема существующих LoRA-подходов
Большинство современных методов параметрически эффективного дообучения (PEFT), таких как стандартные Low-Rank Adapters (LoRA), работают в режиме single-task (одна задача на модель) и представляют обновление весов мультипликативно. Это скрывает истинную природу знаний: модель не объясняет, какие параметры являются общими для группы задач, а какие — уникальными для конкретной. JIVEAdapter решает эту проблему, внедряя статистический подход Joint and Individual Variation Explained (JIVE).
Архитектура JIVEAdapter: Аддитивное разложение
В отличие от традиционных подходов, JIVEAdapter использует аддитивную структуру. Каждое обновление весов разбивается на две независимые части:
- Joint (Общая структура): Уникальный пул параметров, обучаемый совместно для всей группы задач. Он фиксируется после обучения и служит «приором» для новых задач.
- Individual (Индивидуальная структура): Специфичные для каждой задачи параметры. Они подвергаются штрафу за ортогональность по отношению к Joint, что гарантирует интерпретируемость и отсутствие «пересечений» знаний.
Ключевые метрики и бенчмарки
Эксперименты проводились на базе модели DeBERTaV3-base с использованием стандартных наборов данных GLUE и SuperGLUE. Результаты показывают, что JIVEAdapter конкурентоспособен с сильными single-task и multi-task baselines при сопоставимом эффективном ранге (effective rank), не требуя сложных архитектурных надстроек.
| Характеристика | JIVEAdapter | Стандартные LoRA/PEFT |
|---|---|---|
| Тип адаптации | Мультизадачная (Additive) | Обычно Single-task (Multiplicative) |
| Разделение знаний | Явное (Joint + Individual) | Скрытое (смешанные веса) |
| Переиспользование | Joint-часть замораживается и используется для новых задач | Требует полного переобучения или инкрементального дообучения с риском катастрофического забывания |
| Сложность архитектуры | Без MoE (Mixture of Experts) | Часто требует MoE или сложных маршрутизаторов |
Практическая польза: Cold Start для новых задач
Главное преимущество JIVEAdapter — экономия ресурсов при добавлении новых задач. Если для новой задачи существует «родственная» задача из обучающей выборки (held-in), система может использовать уже замороженный Joint-пул и применить лишь дешевое масштабирование для индивидуального вектора. Если родственной задачи нет, обучается новый небольшой Individual-блок, не затрагивая общие веса. Это значительно снижает вычислительные затраты на развертывание мультизадачных LLM в продакшене.
Источник: arXiv cs.AI ↗
