DOOM как полигон для ИИ: результаты первых боев
Лаборатория Rootly AI Labs представила DOOM Agent Arena — первую среду для сравнительного тестирования ИИ-агентов в реальном времени. Вместо стандартных текстовых задач, модели сражаются друг с другом в легендарном шутере DOOM. Проект использует протокол MCP (Model Context Protocol), где ИИ не управляет каждым движением персонажа, а формирует тактические маршруты и цели, которые исполняет движок игры.
В первом раунде соревнований приняли участие четыре модели от OpenAI. Каждая пара провела по 20 зеркальных раундов (всего 60 матчей на модель), что позволило получить статистически значимые данные о способности ИИ к пространственному планированию, адаптации и ресурсному контролю.
Лидерборд: GPT-5.5 и GPT-5.4-mini
Результаты показали явное преимущество старших моделей в тактическом мышлении, но также выявили критическую зависимость от стоимости токенов. GPT-5.5 стала безоговорочным лидером, продемонстрировав не только высокую долю побед, но и лучшую эффективность затрат.
| Модель | Win Rate | Решения (ср.) | Точность | Урон (diff) | Эффективность ($) |
|---|---|---|---|---|---|
| gpt-5.5 🏆 | 66.7% | 6.9s | 51% 🎯 | +22.5 💥 | 0.26× |
| gpt-5.4 | 52.5% | 8.1s | 45% | +13.9 | 0.43× |
| gpt-5.3-codex-spark | 41.7% | 6.6s ⚡ | 38% | −15.9 | n/a |
| gpt-5.4-mini | 39.2% | 11.8s | 40% | −20.5 | 1.00× 💰 |
Ключевой инсайт: контроль ресурсов важнее скорости
Главным фактором победы стал не просто «ум» модели, а умение управлять ресурсами. GPT-5.5 зафиксировала 30 подтвержденных подборов аптечек — более чем в два раза больше, чем у ближайшего конкурента. Модель систематически использовала маршруты отступления для восстановления здоровья, что позволило ей выигрывать 80% раундов, когда она получала доступ к дробовику.
Интересно, что самая быстрая модель (gpt-5.3-codex-spark, 6.6 сек на решение) заняла третье место. Исследователи отмечают: медленное принятие решений часто было сигналом проблем, а не глубокого анализа. Однако скорость имеет значение в длинных сессиях: быстрая отправка планов снижает задержки при сборе метрик и логировании.
Уроки для инцидент-менеджмента
Rootly AI Labs подчеркивают, что паттерны, выявленные в DOOM, напрямую применимы к автоматизации реагирования на инциденты (AIOps):
- Гибридные архитектуры: Механические диагностические шаги лучше делегировать быстрым легким моделям, а сложные суждения — тяжелым.
- Код против рассуждений: В длительных сессиях (30+ раундов) GPT-5.5 начала писать собственные Python-контроллеры, заменяя пошаговые запросы. Закодированные рабочие процессы оказались дешевле, быстрее и прозрачнее.
- Скорость как кумулятивный эффект: В длинных расследованиях преимущество в скорости принятия решений на каждом шаге складывается в общий выигрыш.
Как это работает технически
Архитектура разделяет управление: ИИ-агент через MCP отправляет высокоуровневый план (цель, маршрут по клеткам карты, обоснование), а движок DOOM (запущенный в WASM через Docker) исполняет низкоуровневые действия: движение, прицеливание, стрельбу. Это исключает тестирование «микроменеджмента» и фокусируется на стратегическом планировании.
Проект открыт для энтузиастов. Запустить арену можно локально через Docker, подключив два любых MCP-совместимых агента (например, Claude Code или Codex) для участия в дуэлях.
Источник: Github ↗
