Исследования4 сентября 2026 г., 05:21 МСК🤖 Auto

MASkills: Непрерывное обучение мультиагентных LLM через библиотеку навыков

Исследователи представили MASkills — фреймворк, который превращает опыт взаимодействия мультиагентных систем в структурированные навыки, обеспечивая их постоянное улучшение без переобучения.

Баннер новости 6739

Проблема накопления опыта в мультиагентных системах

Мультиагентные системы на базе больших языковых моделей (LLM) демонстрируют выдающиеся результаты в решении сложных задач, однако их способность к непрерывному улучшению на основе прошлого опыта остается узким местом. Существующие методы саморефлексии создают «память» об опыте, но эта память часто оказывается трудноизвлекаемой, не поддается эффективной доработке и плохо масштабируется. Исследователи предлагают заменить абстрактную память на навыки (skills) — структурированные процедурные знания, которые четко определяют: когда действовать, как действовать и какие инструменты использовать.

Архитектура MASkills: от кредита до оптимизации

Новый фреймворк MASkills (Multi-Agent Skills) внедряет конвейер оптимизации агентов, состоящий из трех ключевых компонентов:

  • Навыко-условное распределение кредита (Skill-conditioned credit assignment): Определяет вклад каждого конкретного навыка в общий успех или провал задачи.
  • Иерархическая агрегация кредита (Hierarchical credit aggregation): Суммирует результаты на разных уровнях абстракции агентов.
  • Оптимизация с импульсным сглаживанием (Momentum-smoothed optimization): Обеспечивает стабильность обновлений, предотвращая резкие изменения в поведении агентов.

Эта архитектура позволяет библиотеке навыков эволюционировать через четыре процесса: уточнение (refinement), индукцию (induction), консолидацию (consolidation) и обрезку (pruning) неэффективных навыков.

Результаты бенчмарков

Эффективность MASkills была протестирована на трех сложных мультиагентных задачах. Ниже приведены ключевые метрики, демонстрирующие преимущество подхода:

GAIA
Бенчмарк Задача Ключевое преимущество MASkills
HotpotQA Многоступенчатые вопросы с поиском Улучшение точности за счет переиспользования успешных стратегий поиска
LoCoMo Координация в сложных сценариях Снижение конфликтов между агентами благодаря оптимизированным протоколам взаимодействия
Генеральные агенты (General AI) Масштабируемость: система становится эффективнее с ростом числа взаимодействий

Значение для индустрии

Работа, представленная на EMNLP 2026 (Findings), закладывает фундамент для создания самообучающихся мультиагентных систем. Переход от «памяти» к «навыкам» позволяет системам не просто запоминать факты, а формировать алгоритмы действий, что критически важно для автономных AI-ассистентов и сложных координируемых задач. Код фреймворка уже доступен для сообщества.

Источник: arXiv cs.AI ↗