Проблема монолитных LLM в агентных системах
Несмотря на мощь больших языковых моделей (LLM), их использование в сложных агентных пайплайнах упирается в фундаментальные ограничения: высокую задержку, риски утечки конфиденциальных данных, зависимость от облачной инфраструктуры и колоссальные вычислительные затраты. В качестве альтернативы исследователи Chengxi Zhang и Yu Yao предлагают использовать небольшие языковые модели (SLM), которые лучше подходят для узкоспециализированных и повторяющихся подзадач.
Новый подход: неинтерактивная оркестрация
Основная проблема SLM — ограниченный контекст и способность к долгосрочному рассуждению. Традиционные стратегии оркестровки, такие как итеративная проверка или дебаты, требуют постоянного взаимодействия моделей, что нивелирует преимущества SLM. Авторы предлагают неинтерактивный парадигмальный подход: гетерогенные SLM независимо генерируют кандидаты на решение, а роутер (OrchSLM) выбирает лучший результат из кэшированных сэмплов без дополнительного взаимодействия с моделями.
OrchSLM как системный зонд
Представленный фреймворк OrchSLM унифицирует существующие методы неинтерактивной оркестровки, превращая скрытые архитектурные решения в управляемые параметры. Это позволяет исследователям и инженерам системно изучать, как поведение системы возникает из различных «ручек» настройки:
- Структура задачи;
- Состав пула моделей (model-pool composition);
- Механизмы консенсуса между агентами.
Значение для индустрии
Работа демонстрирует, что эффективность сложных агентных систем можно повысить не только за счет увеличения размера моделей, но и через грамотную архитектуру маршрутизации. OrchSLM открывает путь к созданию дешевых, быстрых и приватных AI-ассистентов, работающих на локальном оборудовании, где каждый шаг взаимодействия с LLM был бы неоправданно дорог.
Источник: arXiv cs.AI ↗
