Проблема фиксированных чанков
В системах Retrieval-Augmented Generation (RAG) стандартным подходом является разбиение корпуса документов на фрагменты фиксированного размера. Однако этот метод часто приводит к возврату длинных отрывков, где связь с вопросом пользователя носит лишь неявный характер. Это создает «шум» для модели и увеличивает затраты на токены.
Решение: Entity-Aware Partitioning (EAR)
Команда авторов (Cenab Batu Bora, Oylum Alatlı, Sebnem Bora, Oguz Dikenelli) предложила метод EAR. Его суть заключается в извлечении нормализованных «якорей сущностей» из вопроса, вариантов ответа и самого корпуса. Система находит локальные окна вокруг этих совпадений и, при необходимости, присоединяет к ним более широкий родительский отрывок через экстрактивное суммирование.
Результаты бенчмарков
Тестирование проводилось на очищенном подмножестве датасета MMLU (153 вопроса) с использованием текстов из открытых учебников. Ключевым показателем стало сокращение объема передаваемых данных без критической потери качества. Метод EAR сократил количество извлекаемых слов на 37,5–40,2% по сравнению с традиционными чанками.
Изменения точности (accuracy) при использовании моделей Mistral, Gemma и DeepSeek показали смешанные, но значимые результаты:
| Модель | Top-k = 3 (изм. точности) | Top-k = 8 (изм. точности) |
|---|---|---|
| Mistral | +5.2 п. | +5.9 п. |
| Gemma | +1.3 п. | -3.3 п. |
| DeepSeek | -3.9 п. | -4.6 п. |
Хотя статистическая значимость изменений не была подтверждена для всех случаев, метод демонстрирует высокую эффективность в снижении информационного шума. Статья принята к публикации в материалах конференции ASYU 2026 и будет доступна в IEEE Xplore.
Источник: arXiv cs.CL ↗
