Новый стандарт коллаборации: Keep Talking And Nobody Explodes
Команда исследователей во главе с Amit Parekh представила GPTNT — специализированный бенчмарк, построенный на кооперативной видеоигре Keep Talking and Nobody Explodes. В отличие от традиционных тестов, где модели решают задачи по отдельности, GPTNT требует от двух ИИ-агентов непрерывного взаимодействия в реальном времени. Один агент видит бомбу, но не имеет инструкции по её обезвреживанию. Второй агент обладает инструкцией, но не видит поле боя. Успех возможен только при эффективной коммуникации и распределении ролей.
Ключевые отличия от существующих метрик
Существующие бенчмарки часто изучают компоненты коллаборации (память, логика, коммуникация) изолированно. GPTNT же имитирует реальные условия работы:
- Асинхронность и реальное время: Агенты должны действовать и общаться параллельно, а не по очереди.
- Асимметрия информации: Ни один агент не обладает полной картиной происходящего.
- Отсутствие заученных решений: Задачи генерируются процедурно, что исключает возможность просто выучить ответы. Исследователи также могут намеренно скрывать инструкцию или партнера, чтобы проверить способность модели выводить решения «на лету».
Результаты тестирования: провал передовых моделей
Эксперименты показали, что современные закрытые и открытые модели (SOTA) не способны выполнить базовую задачу. Ни одна из протестированных систем не обезвредила ни одной бомбы в реальном времени, в то время как человеческие игроки успешно справляются с этой задачей. Исследователи выделили четыре критические слабости:
- Неспособность отслеживать состояние системы (state tracking).
- Неэффективные действия в условиях временного давления.
- Проблемы с обработкой неоднозначности в речи.
- Отсутствие механизмов восстановления после ошибок.
Почему это важно для индустрии
GPTNT решает проблему «решенных» датасетов. Благодаря процедурной генерации задач и поддержке сообщества моддеров, бенчмарк может эволюционировать вместе с развитием моделей. Это позволяет измерять прогресс в реальной коллаборации, а не просто в запоминании паттернов. Проект открыт для сообщества, включая код и веб-сайт, что дает возможность разработчикам интегрировать свои модели в тестовую среду.
Источник: arXiv cs.AI ↗
