Проблема накопления опыта в мультиагентных системах
Мультиагентные системы на базе больших языковых моделей (LLM) демонстрируют выдающиеся результаты в решении сложных задач, однако их способность к непрерывному улучшению на основе прошлого опыта остается узким местом. Существующие методы саморефлексии создают «память» об опыте, но эта память часто оказывается трудноизвлекаемой, не поддается эффективной доработке и плохо масштабируется. Исследователи предлагают заменить абстрактную память на навыки (skills) — структурированные процедурные знания, которые четко определяют: когда действовать, как действовать и какие инструменты использовать.
Архитектура MASkills: от кредита до оптимизации
Новый фреймворк MASkills (Multi-Agent Skills) внедряет конвейер оптимизации агентов, состоящий из трех ключевых компонентов:
- Навыко-условное распределение кредита (Skill-conditioned credit assignment): Определяет вклад каждого конкретного навыка в общий успех или провал задачи.
- Иерархическая агрегация кредита (Hierarchical credit aggregation): Суммирует результаты на разных уровнях абстракции агентов.
- Оптимизация с импульсным сглаживанием (Momentum-smoothed optimization): Обеспечивает стабильность обновлений, предотвращая резкие изменения в поведении агентов.
Эта архитектура позволяет библиотеке навыков эволюционировать через четыре процесса: уточнение (refinement), индукцию (induction), консолидацию (consolidation) и обрезку (pruning) неэффективных навыков.
Результаты бенчмарков
Эффективность MASkills была протестирована на трех сложных мультиагентных задачах. Ниже приведены ключевые метрики, демонстрирующие преимущество подхода:
| Бенчмарк | Задача | Ключевое преимущество MASkills |
|---|---|---|
| HotpotQA | Многоступенчатые вопросы с поиском | Улучшение точности за счет переиспользования успешных стратегий поиска |
| LoCoMo | Координация в сложных сценариях | Снижение конфликтов между агентами благодаря оптимизированным протоколам взаимодействия | Генеральные агенты (General AI) | Масштабируемость: система становится эффективнее с ростом числа взаимодействий |
Значение для индустрии
Работа, представленная на EMNLP 2026 (Findings), закладывает фундамент для создания самообучающихся мультиагентных систем. Переход от «памяти» к «навыкам» позволяет системам не просто запоминать факты, а формировать алгоритмы действий, что критически важно для автономных AI-ассистентов и сложных координируемых задач. Код фреймворка уже доступен для сообщества.
Источник: arXiv cs.AI ↗
