Исследования18 сентября 2026 г., 09:17 МСК🤖 Auto

Исследование: частота поиска в LLM не гарантирует качество ответа

Первое комплексное исследование (invivo + invitro) показало, что ChatGPT, Claude, Grok и DeepSeek по-разному используют веб-поиск, а частота запросов не коррелирует с точностью ответов.

Баннер новости 7773

Масштаб исследования: от реальных пользователей к API

Команда исследователей во главе с Махсой Аманни (Mahsa Amani) провела первый в своем роде анализ полного жизненного цикла агентов с веб-поиском. Работа объединила два подхода: invivo (анализ реальных взаимодействий пользователей) и invitro (контролируемые эксперименты через API тех же моделей). В фокусе оказались четыре ключевые платформы: ChatGPT, Claude, Grok и DeepSeek.

Ключевые метрики и находки

Авторы изучили четыре этапа работы агента: решение о поиске, стратегию формирования запроса, доменную предпочтительность результатов и трансформацию данных в ответ. Основные выводы:

  • Гетерогенность решений: Платформы кардинально различаются в том, когда они решают вызвать веб-поиск. Нет единого стандарта «умного» поведения.
  • Миф о частоте: Более частое invocation (вызов) веб-поиска не гарантирует более высокое качество итогового ответа. Избыточные запросы могут даже снижать релевантность.
  • Доменные предпочтения: Разные платформы возвращают результаты из разных доменов, что указывает на скрытые алгоритмические предпочтения или различия в используемых поисковых движках.
  • Проблема атрибуции: Хотя ответы в основном основаны на найденных данных, часть утверждений опирается на результаты поиска без явного цитирования, что создает риски для надежности и прослеживаемости источников.

Сравнение стратегий поиска

Исследование выявило, что агенты используют сложные стратегии формулирования запросов, которые сильно зависят от конкретной модели и платформы. Ниже приведена сводная характеристика выявленных паттернов:

Платформа/Модель Стратегия поиска Качество атрибуции
ChatGPT Адаптивное формирование запросов Высокая, но есть случаи неявного использования
Claude Детализированные многошаговые запросы Хорошая прозрачность источников
Grok Агрессивный поиск в реальном времени Средняя, требует проверки ссылок
DeepSeek Контекстно-зависимые уточнения Разрозненная, есть пробелы в цитировании

Почему это важно

Результаты исследования имеют прямое отношение к дизайну будущих AI-агентов. Понимание того, что «больше поиска» ≠ «лучше ответ», позволяет оптимизировать затраты на вычисления и улучшать пользовательский опыт. Для разработчиков инструментов поиска это сигнал к необходимости создания интерфейсов, оптимизированных именно для конвейера конвейерного извлечения информации (conversational retrieval), а не просто для выдачи ссылок.

Источник: arXiv cs.AI ↗