Инструменты31 августа 2026 г., 16:20 МСК🤖 Auto

RAG: Сложность должна быть заслужена. Почему простой BM25 часто лучше агентов

Авторы статьи из Towards Data Science доказывают, что внедрение сложных агентов и переписывания запросов в RAG-системах часто маскирует фундаментальные провалы в поиске. Простая лексическая retrieval-стратегия остается конкурентоспособной базой.

Баннер новости 6423

Проблема: ложное усложнение архитектуры

Современные RAG-системы (Retrieval-Augmented Generation) часто превращаются в «монстров» архитектуры. Разработчики добавляют переписывание запросов, маршрутизацию, несколько проходов поиска, рефлексию, коррективный поиск и агентов, принимающих решения о необходимости дополнительных доказательств. Однако это делается до того, как будет доказана эффективность базового поискового подсистемы.

Ключевая проблема: если релевантное доказательство не попало в топ-k кандидатов, никакая сложная логика генерации или агента не исправит ошибку. Модель может выдать правдоподобный, но неверный ответ, основанный на общих паттернах, но система уже провалила этап извлечения. Сложность должна вводиться только как ответ на измеренные режимы отказа (failure modes), а не как архитектурная дань моде.

Разделение ответственности: Поиск vs Генерация

Важно разделять две концептуально разные операции:

  • Retrieval (Извлечение): идентификация информации, содержащей ответ.
  • Generation (Генерация): интерпретация извлеченной информации и построение ответа.

Если в корпоративной базе по контрактам запрос о «процедурах расторжения при нарушении SLA» возвращает общие обязательства и платежи, но пропускать конкретную статью о расторжении, то проблема исключительно в поиске. Изменение промпта для генерации не вернет данные, которых нет в контекстном окне модели. Главный диагностический вопрос: «Было ли необходимое доказательство в извлеченном наборе кандидатов?» — должен решаться до оптимизации слоя рассуждений.

Возвращение к основам: BM25 как сильная база

Распространенное заблуждение, что эмбеддинги (семантический поиск) полностью заменили лексический поиск, ошибочно. BM25 остается высококонкурентным механизмом, особенно в специализированных доменах, где важны точные совпадения терминов, идентификаторов, кодов ошибок или юридических ссылок.

Например, модель на основе эмбеддингов может понять, что «TS-999» — это техническая ошибка, но ранжировать семантически похожий текст выше документа с точным совпадением «TS-999». BM25, напротив, сильно вознаграждает точные лексические совпадения. Исследование 2026 года, охватившее 23 088 финансовых вопросов, показало, что BM25 превзошел современные методы dense retrieval в специфических условиях.

Гибридный подход: Лучшее из двух миров

Лексический поиск слаб, когда запрос и документ используют разную терминологию (например, пользователь спрашивает «как уволиться», а документ говорит об «инициированном сотрудником расторжении»). Здесь вступают в силу эмбеддинги. Оптимальная архитектура — гибридная:

  1. Использовать дешевые механизмы (BM25 + Dense) для максимизации охвата (recall).
  2. Применять более дорогой reranking-модель на втором этапе для точной сортировки.

Только после того, как гибридный поиск обеспечивает стабильное извлечение доказательств, имеет смысл внедрять агентов для многошаговых или сложных логических задач.

Источник: Towards Data Science ↗