Проблема существующих бенчмарков
Современные тесты для генеративных агентов часто делятся на два типа: «заземленные» (grounded), где есть исполняемые действия и состояние среды, и «социальные симуляции», где агенты взаимодействуют друг с другом. Однако ни один из подходов не проверяет ключевую способность агента: когда именно искать информацию, а когда действовать. В реальных социальных условиях знания раздроблены между разными ролями, и доступ к ним ограничен.
Что такое Incognita
Авторы Dan C. Hsu и Luke Lu представили Incognita — фреймворк на базе Concordia, который разделяет социальное взаимодействие и физическое исполнение. Архитектура включает:
- Маршрутизацию сообщений: агент решает, кому писать — пользователю или узким специалистам.
- Специалистов-посредников: они разрешают допустимые операции.
- Детерминированную под-среду: выполняет принятые операции с каноническим состоянием.
- Офлайн-оценщика: выставляет баллы на основе унаследованных вознаграждений.
Результаты тестирования
Для проверки была использована модификация Incognita-Retail (на базе tau-bench retail). Тестировались три модели генеративных агентов на 18 задачах, разделенных по широте социального взаимодействия. Всего проведено 540 испытаний.
Ключевые метрики прогресса и надежности:
| Метрика | Исходное состояние | Результат (слабые модели) | Результат (сильные модели) |
|---|---|---|---|
| Успешность (Success Rate) | 0% | 8.9% | 17.2% |
| Преждевременное завершение (Premature Finalization) | 100% | 87% | 58% |
Почему это важно
Исследование показывает, что даже сильные модели пока не могут надежно действовать в распределенных социальных средах. Хотя более мощные модели чаще извлекают скрытые знания, связываются с большим числом сущностей и пытаются выполнить больше действий, их надежность остается низкой. Incognita позволяет выявить эти проблемы на этапе «поведения» (запросы, выбор источников), а не только после финального результата, что критично для разработки автономных агентов.
Источник: arXiv cs.AI ↗
