Исследования30 июня 2026 г., 11:47 МСК🤖 Auto

GPTNT: Почему ИИ-агенты провалили взрывчатку, а люди — нет

Исследователи представили GPTNT — первый бенчмарк для оценки реальной совместной работы мультимодальных агентов в условиях дефицита времени и асимметрии информации. Ни одна из протестированных моделей не смогла обезвредить бомбу.

Баннер новости 2554

Новый стандарт коллаборации: Keep Talking And Nobody Explodes

Команда исследователей во главе с Amit Parekh представила GPTNT — специализированный бенчмарк, построенный на кооперативной видеоигре Keep Talking and Nobody Explodes. В отличие от традиционных тестов, где модели решают задачи по отдельности, GPTNT требует от двух ИИ-агентов непрерывного взаимодействия в реальном времени. Один агент видит бомбу, но не имеет инструкции по её обезвреживанию. Второй агент обладает инструкцией, но не видит поле боя. Успех возможен только при эффективной коммуникации и распределении ролей.

Ключевые отличия от существующих метрик

Существующие бенчмарки часто изучают компоненты коллаборации (память, логика, коммуникация) изолированно. GPTNT же имитирует реальные условия работы:

  • Асинхронность и реальное время: Агенты должны действовать и общаться параллельно, а не по очереди.
  • Асимметрия информации: Ни один агент не обладает полной картиной происходящего.
  • Отсутствие заученных решений: Задачи генерируются процедурно, что исключает возможность просто выучить ответы. Исследователи также могут намеренно скрывать инструкцию или партнера, чтобы проверить способность модели выводить решения «на лету».

Результаты тестирования: провал передовых моделей

Эксперименты показали, что современные закрытые и открытые модели (SOTA) не способны выполнить базовую задачу. Ни одна из протестированных систем не обезвредила ни одной бомбы в реальном времени, в то время как человеческие игроки успешно справляются с этой задачей. Исследователи выделили четыре критические слабости:

  1. Неспособность отслеживать состояние системы (state tracking).
  2. Неэффективные действия в условиях временного давления.
  3. Проблемы с обработкой неоднозначности в речи.
  4. Отсутствие механизмов восстановления после ошибок.

Почему это важно для индустрии

GPTNT решает проблему «решенных» датасетов. Благодаря процедурной генерации задач и поддержке сообщества моддеров, бенчмарк может эволюционировать вместе с развитием моделей. Это позволяет измерять прогресс в реальной коллаборации, а не просто в запоминании паттернов. Проект открыт для сообщества, включая код и веб-сайт, что дает возможность разработчикам интегрировать свои модели в тестовую среду.

Источник: arXiv cs.AI ↗