Проблема: от одного ответа к большим коллекциям
Большинство существующих бенчмарков (как DRACO от той же Perplexity) проверяют качество одного длинного отчета. WANDR (Wide ANd Deep Research) решает другую задачу: проверка способности агента собрать обширную, часто неограниченную коллекцию сущностей, где каждая запись подкреплена доказательствами. Это критично для реальных бизнес-задач: конкурентного анализа, юридической проверки (due diligence) и обзоров литературы.
Методология: иерархия и верификация
WANDR использует композиционную иерархию ключей квалификации. Задача может требовать, например, найти n компаний, m сотрудников в каждой и k подтверждающих страниц. Градер не просто сверяет с ответом, а пере-загружает cited URL, проверяет, что страница доступна, и что выдержки действительно поддерживают утверждение.
Всего в датасет включено 500 задач, требующих в сумме 170 495 записей, подкрепленных источниками. Сложность зависит не только от масштаба, но и от объема работы на одну запись.
Результаты: лидерство Perplexity и разрыв с конкурентами
Perplexity протестировала шесть продакшн-систем. Лидером стала собственная архитектура Perplexity Search as Code (SaC), однако даже она не достигла идеального результата. Главные проблемы всех систем — провалы на этапе обнаружения (discovery) и извлечения доказательств.
| Система | Soft F1 | Hard F1 | Примечания |
|---|---|---|---|
| Perplexity (Search as Code) | 0.363 | 0.133 | $5.20/задача, 14.9 мин, 3.82M токенов |
| Anthropic | 0.249 | 0.072 | Ближайший по качеству, но дороже и медленнее |
| Другие (лучшие) | 0.121 | 0.035 | OpenAI, Exa быстрее и дешевле, но ниже баллы |
Ключевые инсайты
- Масштаб усугубляет ошибки: Глубокие иерархии создают множественные точки отказа. Чем глубже дерево, тем ниже recall.
- Проблема доказательств: Найти страницу легко, но извлечь из нее корректные выдержки сложно. У Perplexity 57.5% выдержек не поддерживают полное утверждение.
- Стоимость: Разброс затрат огромен — от $0.03 до $324.83 за задачу в зависимости от настроек и сложности.
Почему это важно
WANDR демонстрирует, что текущие LLM-агенты еще не готовы к автономной работе с большими массивами фактологических данных без человеческого контроля. Архитектура Search as Code, использующая детерминированный код для рутинных операций (фильтрация, дедупликация), показала себя эффективнее чистого генеративного подхода. Бенчмарк открыт для сообщества, что позволит стандартизировать оценку «широких» исследовательских агентов.
Источник: MarkTechPost ↗
