Суть эксперимента
Исследование, проведенное на платформе Towards Data Science, ставит под сомнение необходимость использования RAG (Retrieval-Augmented Generation) в пользу моделей с огромным контекстным окном. В тесте участвовала модель Kimi K3 с поддержкой контекста до 1 миллиона токенов. Её результаты сравнивались с классическим RAG-пайплайном (топ-5 по релевантности) на одном и том же наборе из 12 вопросов и едином системном промпте. Оценка проводилась вслепую по критериям корректности, полноты и обоснованности ответов.
Ключевые метрики
Несмотря на то, что оба подхода продемонстрировали сопоставимое качество ответов, экономические и временные показатели оказались разными. Использование полного контекста (127 000 токенов в тестовом примере) требует значительных вычислительных ресурсов на этапе промптинга, тогда как RAG оптимизирует входные данные, извлекая только необходимую информацию.
| Параметр | Kimi K3 (Полный контекст) | RAG (Топ-5 документов) |
|---|---|---|
| Контекстное окно | До 1 000 000 токенов | Ограничено размером чанков |
| Качество ответа | Высокое (сравнимо с RAG) | Высокое (сравнимо с K3) |
| Задержка (Latency) | Выше (обработка всего контекста) | Ниже (только релевантные фрагменты) |
| Стоимость (Cost) | Выше (больше входных токенов) | Ниже (оптимизация ввода) |
Почему это важно
Результаты показывают, что «больше» не всегда значит «лучше» с точки зрения эффективности. Для задач, где критичны скорость отклика и стоимость запросов, классический RAG остается более рациональным выбором, даже если модель способна вместить весь документ в контекст. Однако для сложных задач, требующих глобального понимания текста без потери деталей, 1-миллионное окно Kimi K3 предоставляет уникальные возможности, которые RAG-системы могут не обеспечить из-за фрагментации данных.
Вывод
Выбор между RAG и длинным контекстом должен зависеть от конкретных требований к задержке и бюджету. RAG выигрывает в эффективности, тогда как Kimi K3 предлагает беспрецедентную глубину анализа «в лоб», не требуя сложной инфраструктуры для индексации и поиска документов.
Источник: Towards Data Science ↗
