Главная/Блог/Аналитика/WANDR: Новый открытый бенчмарк для…
Аналитика9 мин чтения · 19 июля 2026 г.

WANDR: Новый открытый бенчмарк для оценки агентов глубоких исследований

Perplexity AI представила WANDR — первый открытый бенчмарк, оценивающий способность AI-агентов собирать широкие и глубокие массивы данных с подтверждением фактов.

WANDR: Новый открытый бенчмарк для оценки агентов глубоких исследований

В мире искусственного интеллекта мы уже давно переросли эпоху простых вопросов и ответов. Сегодня команды делегируют агентам сложные задачи: от конкурентного анализа до проверки юридической чистоты сделок (due diligence) и обзора научной литературы. Однако большинство существующих бенчмарков тестируют агентов на способность найти один правильный ответ. Они не оценивают умение системы собрать большой, структурированный массив данных, подкрепленный доказательствами. Именно этот пробел пытается заполнить Perplexity AI, выпустив новый открытый инструмент под названием WANDR.

WANDR (Wide ANd Deep Research) — это не просто набор тестовых вопросов. Это полноценная платформа для оценки, построенная вокруг 500 реалистичных, сложных задач сбора данных. Если предыдущий бенчмарк Perplexity, DRACO, проверял, может ли агент написать точный и полный длинный отчет, то WANDR задает более сложный вопрос: может ли агент построить обширную коллекцию данных, где каждое утверждение подкреплено надежным источником? Это переход от генерации текста к генерации проверяемой структуры знаний.

01Что такое WANDR и почему это важно?

В основе WANDR лежит сочетание двух ключевых требований, которые часто противоречат друг другу в контексте работы LLM (больших языковых моделей). Первое требование — Wide (Широта). Это означает необходимость обнаружения большого, часто неограниченного набора сущностей. Например, найти все компании в определенной отрасли, соответствующие критериям. Второе требование — Deep (Глубина). Это означает, что для каждой обнаруженной сущности необходимо провести достаточно глубокое исследование, чтобы подтвердить каждое утверждение конкретными доказательствами.

Комбинация этих двух аспектов кардинально меняет задачу для агентов. Здесь недостаточно привести несколько убедительных примеров или создать гладкий нарратив, основанный на неполных данных. Агент должен продемонстрировать системный подход к сбору информации, где каждое звено цепи (от поиска компании до подтверждения факта о ее руководителе) является критически важным.

💡
Ключевое отличие от DRACO. DRACO фокусируется на качестве итогового документа (отчета). WANDR фокусируется на качестве и полноте исходных данных (коллекции записей). Это более фундаментальный уровень проверки, так как ошибка в исходных данных делает любой последующий анализ бессмысленным.

02Иерархия ключей квалификации: как устроена структура

Чтобы измерить эти сложные требования, WANDR использует композиционную иерархию ключей квалификации. Эта структура позволяет описывать задачи любой сложности: от простых плоских списков до вложенных матриц данных. Рассмотрим пример: задача может запрашивать company(n) -> employee(m) -> url(k). Это означает, что агент должен найти n qualifying компаний, для каждой из них найти m сотрудников, и для каждого сотрудника предоставить k подтверждающих страниц.

Каждый полный путь через это дерево проверяется независимо. Такая гибкость позволяет моделировать реальные сценарии работы с данными, где информация часто имеет вложенную структуру. Например, при анализе рынка вам может потребоваться не просто список компаний, а иерархия: Компания -> Директор -> Ссылка на пресс-релиз о назначении -> Ссылка на профиль директора в LinkedIn.

Конкретный пример задачи: CEO и CFO

Чтобы понять, как это работает на практике, рассмотрим опубликованную задачу ceo_cfo_appointments. Агенту требуется найти как минимум 70 компаний, базирующихся в США. Критерий отбора: назначение генерального директора (CEO) или финансового директора (CFO) должно быть впервые анонсировано в период с 1 марта по 30 апреля 2026 года. Для каждой компании агент должен предоставить одну авторитетную страницу с информацией о назначении. Дополнительно требуется страница, подтверждающая авторитетность источника (listing-authority page).

WANDR: Новый открытый бенчмарк для оценки агентов глубоких исследований

Итого задача требует 140 записей, подкрепленных источниками. Структура данных выглядит следующим образом:

terminalpython
# Task hierarchies
company
70
->
company_appointee
->
url
# 70 appointment records

company
70
->
url
# 70 listing records

# One record the grader re-fetches and re-checks (values are illustrative)
{
  "item": "Example Corp - new CFO",
  "url": "https://issuer.example.com/press/cfo-appointment",
  "excerpts": "Example Corp today named Jane Doe as Chief Financial Officer, effective April 2026.",
  "answer": "Jane Doe appointed CFO; announced April 2026"
}

Обратите внимание, как строго определены поля. Агент не просто должен найти URL, но и извлечь конкретные выдержки (excerpts), которые напрямую поддерживают ответ (answer). Это исключает возможность «галлюцинаций» или подбора общих фраз.

03Генерация задач: от реального использования к тестам

Одной из сильных сторон WANDR является методология создания задач. В отличие от многих бенчмарков, которые генерируют синтетические промпты, WANDR строит свои задачи на основе реальных паттернов использования, наблюдаемых в продакшене. Данные обезличиваются, а затем с помощью полуавтоматического конвейера превращаются в тестовые задания.

Этот конвейер проходит четыре этапа: seeding (засев), authoring (авторство), admission (допуск) и curation (кураторство). Используется цикл «автор-критик» с механической проверкой синтаксиса (linting). Это обеспечивает высокое качество и реалистичность задач.

📌
Статистика сложности. Медианная задача требует найти 50 элементов и собрать в общей сложности 245 записей. Всего по 500 задачам требуется 170 495 записей, подкрепленных источниками. Задачи разделены на три уровня сложности (низкий, средний, высокий) — по 167 задач в каждой группе. Сложность зависит не только от масштаба, но и от объема работы, необходимой для каждой отдельной записи.

04Как WANDR оценивает агентов: система вердиктов

Традиционные бенчмарки часто используют фиксированные ключи ответов. WANDR же оценивает каждое утверждение против цитируемых доказательств. Каждая запись содержит элемент, URL, выбранные выдержки и ответ. Во время оценки система WANDR повторно загружает страницу по указанному URL. Она проверяет, является ли страница рабочей и находится ли она в пределах допустимого диапазона. Затем она верифицирует, что выдержки действительно присутствуют на странице и поддерживают каждое требование.

Бинарные вердикты по каждой записи суммируются через иерархию, формируя итоговые метрики:

WANDR: Новый открытый бенчмарк для оценки агентов глубоких исследований
  • Recall (Полнота): Измеряет качество-скорректированное завершение. Если агент пропустил запись, это засчитывается как ноль. Это строгая метрика, показывающая, насколько полно агент выполнил задачу.
  • Precision (Точность): Измеряет качество того, что система представила. Если агент предоставил ложную информацию, это снижает точность.
  • Soft scores (Мягкие оценки): Дают частичный кредит за неполные элементы. Например, если агент нашел 50 из 70 компаний, он получит баллы за эти 50, даже если остальные отсутствуют.
  • Hard scores (Жесткие оценки): Учитывают только те элементы, у которых все поддерево (все уровни иерархии) верно. Это самая строгая метрика, показывающая способность агента доводить задачу до конца.

05Результаты бенчмарка: кто лидирует?

Используя эту методологию, Perplexity протестировала шесть производственных систем на всех 500 задачах. Результаты показали, что ни одна из существующих систем не справляется с задачей идеально. Однако есть явный лидер.

Система Perplexity Search as Code (SaC) показала лучшие результаты, но даже она не достигла высоких показателей. Вот сводная таблица результатов:

Система Soft F1 Hard F1 Примечания
Perplexity (Search as Code) 0.363 0.133 $5.20/задача, медиана 14.9 мин, 3.82M токенов/задача
Anthropic 0.249 0.072 Ближайший по качеству, но требует больше времени, денег и токенов
Другие (лучшие) 0.121 0.035 OpenAI, Exa быстрее и дешевле, но имеют более низкие баллы

При увеличении усилий (настройка xhigh) Perplexity достигает Soft F1 на уровне 0.447. Однако стоимость варьируется в пределах четырех порядков величины: от $0.03 за задачу до $324.83 за задачу. Это подчеркивает важность оптимизации процессов поиска.

⚠️
Важный вывод. Даже у лидера бенчмарка Hard F1 составляет всего 0.133. Это означает, что в большинстве случаев агенты не могут полностью завершить все ветки иерархии данных. Проблема масштабирования остается критической.

06Четыре ключевых вывода из результатов

Помимо лидерборда, анализ данных выявил четыре фундаментальных вывода о текущем состоянии AI-агентов:

  1. Частичный прогресс распространен, но полное покрытие отсутствует. У каждой системы Soft Recall ниже, чем Soft Precision. Это означает, что агенты лучше находят данные, чем завершают их сбор до конца. Они часто останавливаются на полпути.
  2. Масштаб усугубляет проблему. Глубокие иерархии наносят наибольший ущерб. Каждая дополнительная ветка добавляет новую точку отказа. Если на каждом шаге есть вероятность ошибки в 5%, то на 10-м шаге вероятность успеха падает до 60%.
  3. Обнаружение (Discovery) — первый структурный узел. Завершение поиска на верхнем уровне варьируется от 0.611 до 0.951. Основная причина недостающих данных — недобор (under-delivery), а не слияние дубликатов. Агенты просто не находят все нужные компании.
  4. Найти страницу легко, собрать доказательства сложно. Для Perplexity 41.4% страниц не удовлетворяют существенным требованиям. Кроме того, 57.5% выдержек не поддерживают полное утверждение. Soft F1 падает с 0.531 (при проверке только поиска) до 0.363 (при полной проверке вердиктов). Это показывает, что главная проблема — не в поиске URL, а в извлечении и верификации контента.
WANDR: Новый открытый бенчмарк для оценки агентов глубоких исследований

Интересно, что подход Search as Code хорошо подходит для этой задачи. Агент может выразить логику поиска, фильтрации, расширения (fan-out), соединения (joins), удаления дубликатов и остановки как программу. Детерминированные вычисления обрабатывают повторяющиеся операции вне контекста модели, что снижает затраты и повышает надежность.

07Практическое применение: где это нужно?

WANDR напрямую映射 (maps) к задачам, которые команды уже автоматизируют. Рассмотрим несколько сценариев:

  • Аналитика рынка: Аналитику нужны все конкурирующие компании с подтверждающими доказательствами для каждого факта. Ошибка в списке конкурентов может привести к неверной стратегии.
  • Due Diligence (Проверка благонадежности): Юридическим командам нужны десятки компаний, их владельцы, руководители и информация о финансировании. Каждая запись должна быть проверена по первоисточникам.
  • Подбор персонала (Talent Sourcing): Рекрутерам нужны сотни кандидатов, каждый с подтверждающими страницами профилей. Здесь важна полнота базы данных.

Поскольку оценка производится по каждой записи, команды могут точно локализовать сбои. Дерево оценок изолирует потери на этапах обнаружения, обогащения или извлечения доказательств. Это помогает инженерам улучшать слабые звенья по одному, а не переписывать всю систему.

08Что это значит на практике

Для разработчиков AI-агентов WANDR становится новым стандартом качества. Если раньше можно было хвастаться тем, что агент «нашел информацию», то теперь требуется доказать, что он нашел всю необходимую информацию с проверяемыми источниками. Это сдвигает фокус с «креативности» моделей на их надежность и системность.

Для бизнеса это означает, что внедрение AI-агентов для сложных исследовательских задач требует тщательной валидации. Использование таких бенчмарков, как WANDR, позволяет измерить реальный ROI (возврат на инвестиции) от внедрения агентов, учитывая не только скорость, но и стоимость ошибки. Пока что, как показывают результаты, ни одна система не готова к полностью автономному выполнению таких задач без человеческого контроля, особенно на этапах верификации доказательств.

Открытый характер WANDR дает возможность всем участникам рынка тестировать свои решения на одинаковых данных, что ускорит развитие агентов, способных работать с большими объемами структурированных знаний. Следующий шаг — снижение стоимости вычислений и повышение точности извлечения доказательств, чтобы Hard F1 приблизился к приемлемым значениям для промышленного использования.

Источник: MarkTechPost ↗