Исследования4 августа 2026 г., 10:16 МСК🤖 Auto

SLM-маршрутизаторы: как малые модели обходят LLM в поиске

Исследователи показали, что небольшие языковые модели (SLM), обученные через RL, эффективнее крупных аналогов (Nova Lite, Haiku) выбирают поисковые агенты, экономя 82% времени.

Баннер новости 5022

Проблема намерений против реальности

Традиционные системы маршрутизации запросов опираются на определение темы или намерения пользователя. Этот подход фундаментально ограничен: он игнорирует качество самих результатов поиска. Если специализированный агент выдает релевантные данные, но система выбрала его по ошибке, или наоборот — топ-результаты низкого качества, классические методы не способны скорректировать выбор.

Команда исследователей под руководством Гаятри В. Кондапалли предложила решение: использовать малую языковую модель (SLM) в качестве многоагентного маршрутизатора, который учится на реальных метриках качества, а не только на семантике запроса.

Методология: SFT и иерархическое подкрепление

Модель прошла двухэтапное обучение. Сначала применялось контролируемое дообучение (SFT), а затем — обучение с подкреплением (RL). Ключевым нововведением стала иерархическая функция вознаграждения, которая оценивает два фактора:

  • Релевантность полученных результатов поиска.
  • Соответствие темы запроса профилю выбранного агента.

Это позволяет модели «понимать», какие агенты стабильно выдают хорошие результаты для конкретных распределений запросов, и вовремя перенаправлять запросы, даже если есть поверхностное совпадение тем.

Результаты: разрыв с лидерами рынка

На тестовой выборке, где агенты и запросы не совпадали (mismatches), новая SLM-архитектура продемонстрировала выдающиеся результаты. Модель превосходит базовые LLM-маршрутизаторы (Amazon Nova Lite и Claude Haiku 4.5), которые принимают решения исключительно на основе намерения.

Метрика Предложенная SLM Amazon Nova Lite Claude Haiku 4.5
NDCG@10 (общий) 0.771 0.594 0.552
NDCG@10 (сложные кейсы) 0.918 0.539 0.490
Задержка (Latency) 120.1 мс ~630 мс
Экономия времени 82.4%

Почему это важно

Результат NDCG@10 на уровне 0.918 на сложных кейсах доказывает, что малые модели могут быть эффективнее гигантов в специфических задачах маршрутизации. Снижение задержки на 82.4% по сравнению с Nova Lite делает этот подход идеальным для систем реального времени, где важна скорость ответа без потери качества поиска.

Источник: arXiv cs.CL ↗