Проблема намерений против реальности
Традиционные системы маршрутизации запросов опираются на определение темы или намерения пользователя. Этот подход фундаментально ограничен: он игнорирует качество самих результатов поиска. Если специализированный агент выдает релевантные данные, но система выбрала его по ошибке, или наоборот — топ-результаты низкого качества, классические методы не способны скорректировать выбор.
Команда исследователей под руководством Гаятри В. Кондапалли предложила решение: использовать малую языковую модель (SLM) в качестве многоагентного маршрутизатора, который учится на реальных метриках качества, а не только на семантике запроса.
Методология: SFT и иерархическое подкрепление
Модель прошла двухэтапное обучение. Сначала применялось контролируемое дообучение (SFT), а затем — обучение с подкреплением (RL). Ключевым нововведением стала иерархическая функция вознаграждения, которая оценивает два фактора:
- Релевантность полученных результатов поиска.
- Соответствие темы запроса профилю выбранного агента.
Это позволяет модели «понимать», какие агенты стабильно выдают хорошие результаты для конкретных распределений запросов, и вовремя перенаправлять запросы, даже если есть поверхностное совпадение тем.
Результаты: разрыв с лидерами рынка
На тестовой выборке, где агенты и запросы не совпадали (mismatches), новая SLM-архитектура продемонстрировала выдающиеся результаты. Модель превосходит базовые LLM-маршрутизаторы (Amazon Nova Lite и Claude Haiku 4.5), которые принимают решения исключительно на основе намерения.
| Метрика | Предложенная SLM | Amazon Nova Lite | Claude Haiku 4.5 |
|---|---|---|---|
| NDCG@10 (общий) | 0.771 | 0.594 | 0.552 |
| NDCG@10 (сложные кейсы) | 0.918 | 0.539 | 0.490 |
| Задержка (Latency) | 120.1 мс | ~630 мс | — |
| Экономия времени | — | 82.4% | — |
Почему это важно
Результат NDCG@10 на уровне 0.918 на сложных кейсах доказывает, что малые модели могут быть эффективнее гигантов в специфических задачах маршрутизации. Снижение задержки на 82.4% по сравнению с Nova Lite делает этот подход идеальным для систем реального времени, где важна скорость ответа без потери качества поиска.
Источник: arXiv cs.CL ↗
