Исследования7 октября 2026 г., 12:19 МСК🤖 Auto

JIVEAdapter: Мультизадачное дообучение LLM без MoE и с разделением знаний

Исследователи представили JIVEAdapter — метод адаптации моделей, который разделяет общие и специфичные для задачи параметры, обеспечивая эффективное мультизадачное обучение на базе DeBERTaV3.

Баннер новости 9100

Проблема существующих LoRA-подходов

Большинство современных методов параметрически эффективного дообучения (PEFT), таких как стандартные Low-Rank Adapters (LoRA), работают в режиме single-task (одна задача на модель) и представляют обновление весов мультипликативно. Это скрывает истинную природу знаний: модель не объясняет, какие параметры являются общими для группы задач, а какие — уникальными для конкретной. JIVEAdapter решает эту проблему, внедряя статистический подход Joint and Individual Variation Explained (JIVE).

Архитектура JIVEAdapter: Аддитивное разложение

В отличие от традиционных подходов, JIVEAdapter использует аддитивную структуру. Каждое обновление весов разбивается на две независимые части:

  • Joint (Общая структура): Уникальный пул параметров, обучаемый совместно для всей группы задач. Он фиксируется после обучения и служит «приором» для новых задач.
  • Individual (Индивидуальная структура): Специфичные для каждой задачи параметры. Они подвергаются штрафу за ортогональность по отношению к Joint, что гарантирует интерпретируемость и отсутствие «пересечений» знаний.

Ключевые метрики и бенчмарки

Эксперименты проводились на базе модели DeBERTaV3-base с использованием стандартных наборов данных GLUE и SuperGLUE. Результаты показывают, что JIVEAdapter конкурентоспособен с сильными single-task и multi-task baselines при сопоставимом эффективном ранге (effective rank), не требуя сложных архитектурных надстроек.

Характеристика JIVEAdapter Стандартные LoRA/PEFT
Тип адаптации Мультизадачная (Additive) Обычно Single-task (Multiplicative)
Разделение знаний Явное (Joint + Individual) Скрытое (смешанные веса)
Переиспользование Joint-часть замораживается и используется для новых задач Требует полного переобучения или инкрементального дообучения с риском катастрофического забывания
Сложность архитектуры Без MoE (Mixture of Experts) Часто требует MoE или сложных маршрутизаторов

Практическая польза: Cold Start для новых задач

Главное преимущество JIVEAdapter — экономия ресурсов при добавлении новых задач. Если для новой задачи существует «родственная» задача из обучающей выборки (held-in), система может использовать уже замороженный Joint-пул и применить лишь дешевое масштабирование для индивидуального вектора. Если родственной задачи нет, обучается новый небольшой Individual-блок, не затрагивая общие веса. Это значительно снижает вычислительные затраты на развертывание мультизадачных LLM в продакшене.

Источник: arXiv cs.AI ↗