Инструменты17 июля 2026 г., 19:46 МСК🤖 Auto

Doom как бенчмарк: GPT-5.5 доминирует в битве ИИ-агентов

Rootly AI Labs превратили классический шутер DOOM в арену для тестирования ИИ. GPT-5.5 показала 66.7% побед, доказав, что стратегическое планирование важнее скорости принятия решений.

Баннер новости 3833

DOOM как полигон для ИИ: результаты первых боев

Лаборатория Rootly AI Labs представила DOOM Agent Arena — первую среду для сравнительного тестирования ИИ-агентов в реальном времени. Вместо стандартных текстовых задач, модели сражаются друг с другом в легендарном шутере DOOM. Проект использует протокол MCP (Model Context Protocol), где ИИ не управляет каждым движением персонажа, а формирует тактические маршруты и цели, которые исполняет движок игры.

В первом раунде соревнований приняли участие четыре модели от OpenAI. Каждая пара провела по 20 зеркальных раундов (всего 60 матчей на модель), что позволило получить статистически значимые данные о способности ИИ к пространственному планированию, адаптации и ресурсному контролю.

Лидерборд: GPT-5.5 и GPT-5.4-mini

Результаты показали явное преимущество старших моделей в тактическом мышлении, но также выявили критическую зависимость от стоимости токенов. GPT-5.5 стала безоговорочным лидером, продемонстрировав не только высокую долю побед, но и лучшую эффективность затрат.

Модель Win Rate Решения (ср.) Точность Урон (diff) Эффективность ($)
gpt-5.5 🏆 66.7% 6.9s 51% 🎯 +22.5 💥 0.26×
gpt-5.4 52.5% 8.1s 45% +13.9 0.43×
gpt-5.3-codex-spark 41.7% 6.6s ⚡ 38% −15.9 n/a
gpt-5.4-mini 39.2% 11.8s 40% −20.5 1.00× 💰

Ключевой инсайт: контроль ресурсов важнее скорости

Главным фактором победы стал не просто «ум» модели, а умение управлять ресурсами. GPT-5.5 зафиксировала 30 подтвержденных подборов аптечек — более чем в два раза больше, чем у ближайшего конкурента. Модель систематически использовала маршруты отступления для восстановления здоровья, что позволило ей выигрывать 80% раундов, когда она получала доступ к дробовику.

Интересно, что самая быстрая модель (gpt-5.3-codex-spark, 6.6 сек на решение) заняла третье место. Исследователи отмечают: медленное принятие решений часто было сигналом проблем, а не глубокого анализа. Однако скорость имеет значение в длинных сессиях: быстрая отправка планов снижает задержки при сборе метрик и логировании.

Уроки для инцидент-менеджмента

Rootly AI Labs подчеркивают, что паттерны, выявленные в DOOM, напрямую применимы к автоматизации реагирования на инциденты (AIOps):

  • Гибридные архитектуры: Механические диагностические шаги лучше делегировать быстрым легким моделям, а сложные суждения — тяжелым.
  • Код против рассуждений: В длительных сессиях (30+ раундов) GPT-5.5 начала писать собственные Python-контроллеры, заменяя пошаговые запросы. Закодированные рабочие процессы оказались дешевле, быстрее и прозрачнее.
  • Скорость как кумулятивный эффект: В длинных расследованиях преимущество в скорости принятия решений на каждом шаге складывается в общий выигрыш.

Как это работает технически

Архитектура разделяет управление: ИИ-агент через MCP отправляет высокоуровневый план (цель, маршрут по клеткам карты, обоснование), а движок DOOM (запущенный в WASM через Docker) исполняет низкоуровневые действия: движение, прицеливание, стрельбу. Это исключает тестирование «микроменеджмента» и фокусируется на стратегическом планировании.

Проект открыт для энтузиастов. Запустить арену можно локально через Docker, подключив два любых MCP-совместимых агента (например, Claude Code или Codex) для участия в дуэлях.

Источник: Github ↗