Исследования7 июля 2026 г., 15:18 МСК🤖 Auto

Incognita: Тест на социальный интеллект для AI-агентов

Исследователи представили Incognita — новую среду для оценки AI-агентов, где знания распределены между участниками, а успех зависит от умения задавать правильные вопросы.

Баннер новости 3034

Проблема существующих бенчмарков

Современные тесты для генеративных агентов часто делятся на два типа: «заземленные» (grounded), где есть исполняемые действия и состояние среды, и «социальные симуляции», где агенты взаимодействуют друг с другом. Однако ни один из подходов не проверяет ключевую способность агента: когда именно искать информацию, а когда действовать. В реальных социальных условиях знания раздроблены между разными ролями, и доступ к ним ограничен.

Что такое Incognita

Авторы Dan C. Hsu и Luke Lu представили Incognita — фреймворк на базе Concordia, который разделяет социальное взаимодействие и физическое исполнение. Архитектура включает:

  • Маршрутизацию сообщений: агент решает, кому писать — пользователю или узким специалистам.
  • Специалистов-посредников: они разрешают допустимые операции.
  • Детерминированную под-среду: выполняет принятые операции с каноническим состоянием.
  • Офлайн-оценщика: выставляет баллы на основе унаследованных вознаграждений.

Результаты тестирования

Для проверки была использована модификация Incognita-Retail (на базе tau-bench retail). Тестировались три модели генеративных агентов на 18 задачах, разделенных по широте социального взаимодействия. Всего проведено 540 испытаний.

Ключевые метрики прогресса и надежности:

Метрика Исходное состояние Результат (слабые модели) Результат (сильные модели)
Успешность (Success Rate) 0% 8.9% 17.2%
Преждевременное завершение (Premature Finalization) 100% 87% 58%

Почему это важно

Исследование показывает, что даже сильные модели пока не могут надежно действовать в распределенных социальных средах. Хотя более мощные модели чаще извлекают скрытые знания, связываются с большим числом сущностей и пытаются выполнить больше действий, их надежность остается низкой. Incognita позволяет выявить эти проблемы на этапе «поведения» (запросы, выбор источников), а не только после финального результата, что критично для разработки автономных агентов.

Источник: arXiv cs.AI ↗