Исследования24 июля 2026 г., 13:17 МСК🤖 Auto

CARGO: маршрутизация LLM без обучения через оценку надежности

Исследователи представили CARGO — фреймворк для распределения нагрузки между локальными и облачными LLM, не требующий дообучения роутера. Система использует внутреннюю согласованность ответов модели для принятия решений.

Баннер новости 4290

Проблема обучения роутеров

Современные подходы к локально-облачному сотрудничеству (local-cloud collaboration) часто требуют обучения специализированных маршрутизаторов или дообучения моделей с учетом архитектуры взаимодействия. Это создает жесткую привязку поведения системы к конкретным условиям эксплуатации и увеличивает затраты на разработку. Авторы работы из arXiv:2607.20486 доказывают, что такие сложные процедуры обучения избыточны.

Механизм CARGO: надежность как сигнал

Предложенный фреймворк CARGO (Controllable-Ratio LLM Offloading via Reliability Gating) принимает решение о передаче запроса в облако на основе анализа собственных ответов локальной модели. Ключевые компоненты системы:

  • Оценка согласованности: генерация нескольких вариантов ответа на один и тот же запрос с вариациями промпта. Высокое расхождение указывает на низкую уверенность модели.
  • Байесовская ранняя остановка: алгоритм, позволяющий эффективно контролировать неопределенность, останавливая генерацию дополнительных сэмплов, когда уверенность достигнута.
  • Калибровка на этапе развертывания: легковесная настройка, позволяющая задавать произвольное соотношение (ratio) использования локальных и облачных ресурсов без переобучения.

Результаты и бенчмарки

Эксперименты проводились на задачах логического вывода (reasoning) и ответа на вопросы (QA) с использованием различных семейств локальных LLM (как pre-trained, так и finetuned). CARGO демонстрирует стабильное превосходство над другими методами без обучения и в ряде сценариев превосходит обученные supervised routers.

Характеристика Традиционные методы CARGO (предлагаемый)
Требование к обучению роутера Да (Supervised/RL) Нет (Training-free)
Гибкость настройки нагрузки Жесткая привязка к режиму Произвольное соотношение (Controllable Ratio)
Источник сигнала для решения Внешние метрики / данные Внутренняя согласованность ответов (Intrinsic Agreement)
Производительность Зависит от качества датасета Превосходит базовые методы без обучения

Значение для индустрии

Результаты показывают, что эффективное распределение вычислительных ресурсов может возникать непосредственно из внутренней динамики работы самой языковой модели. Это упрощает внедрение гибридных архитектур: разработчикам больше не нужно поддерживать отдельные обученные модели-маршрутизаторы, а можно полагаться на «здравый смысл» базовой LLM, оценивая её собственную уверенность в ответе.

Источник: arXiv cs.AI ↗