Исследования10 августа 2026 г., 14:18 МСК🤖 Auto

AgentPatch: Как слить модели без потери навыков агентов

Исследователи представили AgentPatch — метод слияния мультимодальных LLM без дообучения, решающий проблему деградации сложных задач при объединении специализированных моделей.

Баннер новости 5430

Проблема: «Синдром разобщенного мозга» при слиянии

Слияние (merging) больших языковых моделей обещает создать универсальные агенты, объединяющие знания из разных источников. Однако на практике возникает две критические проблемы, которые AgentPatch называет asymmetric capability preservation (асимметричное сохранение способностей) и behavior-critical forgetting (забывание критически важного поведения). Простое усреднение весов приводит к тому, что модель теряет способность выполнять сложные многошаговые задачи, даже если сохранила базовые навыки.

Решение: Коarse-to-Fine (от грубого к тонкому)

Команда авторов (Zibo Shao и соавт.) предложила AgentPatch — фреймворк, не требующий дообучения (training-free). Метод работает в два этапа:

  • Weak-Task Unique Residual Recovery: Восстановление сигналов, специфичных для слабых задач, которые «размываются» при обычном слиянии.
  • Agent-Guided Behavior-Critical Patch: Точечное восстановление решений, критичных для долгосрочного выполнения агентами, с защитой уже имеющихся компетенций.

Результаты: Улучшение без компромиссов

Эксперименты проводились на шести бенчмарках для агентов и мультимодальных моделей. AgentPatch позволяет получить единый статический чекпоинт, избегая необходимости использовать роутинг или ансамбли моделей. Метод эффективно балансирует между восстановлением слабых задач и сохранением навыков поиска и визуальной обработки.

Ключевая метрика/Аспект Описание эффекта AgentPatch
Тип метода Training-free (без дообучения), coarse-to-fine
Основная проблема Деградация сложных (weak-task) и критических поведенческих навыков
Архитектура результата Единый статический чекпоинт (без роутинга/ансамблей)
Валидация 6 бенчмарков (agentic & multimodal)

Значение для индустрии

AgentPatch открывает путь к созданию более мощных универсальных агентов, объединяя лучшие черты специализированных моделей. Отсутствие необходимости в дообучении снижает вычислительные барьеры для внедрения таких слияний в реальные продукты.

Источник: arXiv cs.AI ↗