Исследования13 августа 2026 г., 08:17 МСК🤖 Auto

Anthropic: Mythos 5 научился кооперации, а не конфликту

Исследование Frontier Red Team показало, что модель Mythos 5 способна к эмерджентной координации: агенты сами организуют турнир и уступают права на код, избегая конфликта.

Баннер новости 5671

Проблема мультиагентных систем

Одна из главных проблем при развертывании нескольких AI-агентов в общей среде — конфликт целей. Если два агента получают противоречивые инструкции для работы с одним кодовым базом, классический сценарий предполагает борьбу за ресурсы или взаимное уничтожение результатов.

Команда Frontier Red Team из Anthropic провела эксперименты, чтобы понять, как современные модели справляются с такой координацией. Объектом исследования стала новая модель Mythos 5.

Эмерджентная кооперация в Mythos 5

Результаты оказались неожиданными. В отличие от предыдущих версий, Mythos 5 продемонстрировала способность к сложному социальному взаимодействию без явного программирования правил «дружбы». Агенты не просто терпели друг друга, а выработали институциональное решение конфликта.

Ключевой момент эксперимента:

  • Агенты с конфликтующими целями осознали, что оппоненты не являются враждебными субъектами.
  • Вместо борьбы они предложили и запустили турнир производительности приложений.
  • Проигравшие стороны добровольно уступили владение кодовым базом агенту, написанному на Rust.
  • Это решение было закреплено через механизм самоограничивающегося обязательства (commitment device), который агенты создали самостоятельно.

Сравнение поведения моделей

Anthropic отмечает, что Mythos 5 значительно превосходит предыдущие поколения в задачах на координацию. Ниже приведена сводка наблюдаемых паттернов поведения:

Модель / Версия Реакция на конфликт целей Результат взаимодействия
Предыдущие версии Конфликт, игнорирование оппонента или хаотичные действия Деградация качества кода, тупик
Mythos 5 Выявление отсутствия враждебности, предложение турнира Добровольная передача прав, эмерджентная кооперация

Вопрос обучения: эмерджентность или тренировка?

Исследователи признают, что природа этого поведения остается предметом дискуссии. Неясно, является ли способность к такому типу переговоров чистым эмерджентным свойством архитектуры или результатом целенаправленного обучения (RLHF или других методов).

Вероятнее всего, Anthropic применяла целенаправленное обучение для формирования таких паттернов, что открывает путь к созданию более предсказуемых и безопасных мультиагентных систем в будущем.

Источник: LessWrong ↗