Проблема качества RAG
Retrieval-Augmented Generation (RAG) стал стандартом для внедрения LLM в корпоративные системы. Однако многие разработчики сталкиваются с парадоксом: модель способна генерировать связный текст, но ответы содержат галлюцинации или не отвечают на вопрос. Исследование, опубликованное в Towards AI, выделяет 10 конкретных ошибок, которые «тихо убивают» качество извлечения информации (retrieval quality).
Критические ошибки в подготовке данных
Первая и самая распространенная проблема — некорректное разбиение документов на чанки (chunking). Простое деление текста по количеству символов часто разрает смысловые связи. Вторая ошибка — отсутствие семантического поиска. Если система использует только ключевые слова (BM25), она пропускает контекстуально релевантные документы. Третья — игнорирование метаданных. Без тегов, дат или авторов поиск становится «слепым».
Ошибки в процессе поиска и ранжирования
Четвертая ошибка — использование только одного метода поиска. Комбинация векторного и текстового поиска (Hybrid Search) значительно повышает точность. Пятая — отсутствие переупорядочивания (reranking). Векторный поиск возвращает 10-20 документов, но не всегда в правильном порядке релевантности. Шестая — игнорирование контекстного окна. Передача слишком большого объема шума в LLM снижает качество ответа.
Технические и архитектурные просчеты
Седьмая ошибка — отсутствие кэширования запросов. Это замедляет систему и увеличивает затраты. Восьмая — плохая обработка ошибок. Если поиск не нашел ничего, система должна явно сообщать об этом, а не галлюцинировать. Девятая — отсутствие мониторинга качества. Без метрик (например, MRR или NDCG) невозможно понять, работает ли оптимизация. Десятая — игнорирование обратной связи от пользователей.
Как измерить успех
Для оценки качества RAG-системы необходимо использовать следующие метрики:
- Recall@K: Насколько много релевантных документов найдено среди первых K результатов.
- Mean Reciprocal Rank (MRR): Средний обратный ранг первого релевантного документа.
- Context Relevance: Насколько предоставленный контекст соответствует вопросу.
- Answer Faithfulness: Насколько ответ опирается на предоставленный контекст, а не на внутренние знания модели.
Практические рекомендации
Для исправления ошибок рекомендуется:
- Использовать семантическое разбиение чанков (например, на основе абзацев или заголовков).
- Применять гибридный поиск (векторный + BM25).
- Внедрять reranker-модели для переупорядочивания результатов.
- Регулярно проводить A/B тесты различных конфигураций.
Эти шаги позволяют значительно повысить точность RAG-систем и снизить количество галлюцинаций, делая их пригодными для критически важных бизнес-задач.
Источник: Towards AI pub ↗