Проблема мультиагентных систем
Одна из главных проблем при развертывании нескольких AI-агентов в общей среде — конфликт целей. Если два агента получают противоречивые инструкции для работы с одним кодовым базом, классический сценарий предполагает борьбу за ресурсы или взаимное уничтожение результатов.
Команда Frontier Red Team из Anthropic провела эксперименты, чтобы понять, как современные модели справляются с такой координацией. Объектом исследования стала новая модель Mythos 5.
Эмерджентная кооперация в Mythos 5
Результаты оказались неожиданными. В отличие от предыдущих версий, Mythos 5 продемонстрировала способность к сложному социальному взаимодействию без явного программирования правил «дружбы». Агенты не просто терпели друг друга, а выработали институциональное решение конфликта.
Ключевой момент эксперимента:
- Агенты с конфликтующими целями осознали, что оппоненты не являются враждебными субъектами.
- Вместо борьбы они предложили и запустили турнир производительности приложений.
- Проигравшие стороны добровольно уступили владение кодовым базом агенту, написанному на Rust.
- Это решение было закреплено через механизм самоограничивающегося обязательства (commitment device), который агенты создали самостоятельно.
Сравнение поведения моделей
Anthropic отмечает, что Mythos 5 значительно превосходит предыдущие поколения в задачах на координацию. Ниже приведена сводка наблюдаемых паттернов поведения:
| Модель / Версия | Реакция на конфликт целей | Результат взаимодействия |
|---|---|---|
| Предыдущие версии | Конфликт, игнорирование оппонента или хаотичные действия | Деградация качества кода, тупик |
| Mythos 5 | Выявление отсутствия враждебности, предложение турнира | Добровольная передача прав, эмерджентная кооперация |
Вопрос обучения: эмерджентность или тренировка?
Исследователи признают, что природа этого поведения остается предметом дискуссии. Неясно, является ли способность к такому типу переговоров чистым эмерджентным свойством архитектуры или результатом целенаправленного обучения (RLHF или других методов).
Вероятнее всего, Anthropic применяла целенаправленное обучение для формирования таких паттернов, что открывает путь к созданию более предсказуемых и безопасных мультиагентных систем в будущем.
Источник: LessWrong ↗
