Масштаб исследования: от реальных пользователей к API
Команда исследователей во главе с Махсой Аманни (Mahsa Amani) провела первый в своем роде анализ полного жизненного цикла агентов с веб-поиском. Работа объединила два подхода: invivo (анализ реальных взаимодействий пользователей) и invitro (контролируемые эксперименты через API тех же моделей). В фокусе оказались четыре ключевые платформы: ChatGPT, Claude, Grok и DeepSeek.
Ключевые метрики и находки
Авторы изучили четыре этапа работы агента: решение о поиске, стратегию формирования запроса, доменную предпочтительность результатов и трансформацию данных в ответ. Основные выводы:
- Гетерогенность решений: Платформы кардинально различаются в том, когда они решают вызвать веб-поиск. Нет единого стандарта «умного» поведения.
- Миф о частоте: Более частое invocation (вызов) веб-поиска не гарантирует более высокое качество итогового ответа. Избыточные запросы могут даже снижать релевантность.
- Доменные предпочтения: Разные платформы возвращают результаты из разных доменов, что указывает на скрытые алгоритмические предпочтения или различия в используемых поисковых движках.
- Проблема атрибуции: Хотя ответы в основном основаны на найденных данных, часть утверждений опирается на результаты поиска без явного цитирования, что создает риски для надежности и прослеживаемости источников.
Сравнение стратегий поиска
Исследование выявило, что агенты используют сложные стратегии формулирования запросов, которые сильно зависят от конкретной модели и платформы. Ниже приведена сводная характеристика выявленных паттернов:
| Платформа/Модель | Стратегия поиска | Качество атрибуции |
|---|---|---|
| ChatGPT | Адаптивное формирование запросов | Высокая, но есть случаи неявного использования |
| Claude | Детализированные многошаговые запросы | Хорошая прозрачность источников |
| Grok | Агрессивный поиск в реальном времени | Средняя, требует проверки ссылок |
| DeepSeek | Контекстно-зависимые уточнения | Разрозненная, есть пробелы в цитировании |
Почему это важно
Результаты исследования имеют прямое отношение к дизайну будущих AI-агентов. Понимание того, что «больше поиска» ≠ «лучше ответ», позволяет оптимизировать затраты на вычисления и улучшать пользовательский опыт. Для разработчиков инструментов поиска это сигнал к необходимости создания интерфейсов, оптимизированных именно для конвейера конвейерного извлечения информации (conversational retrieval), а не просто для выдачи ссылок.
Источник: arXiv cs.AI ↗
