Инструменты27 сентября 2026 г., 18:17 МСК🤖 Auto

Проблема границ агентов: почему один 20B-модель лучше трёх

Автор внедрил в продакшен систему голосовых собеседований на базе одной 20B-модели, достигнув задержки 557 мс. Секрет — в отказе от мультиагентной архитектуры в пользу единого оркестратора с переключением ролей.

Баннер новости 8376

Архитектурный выбор: один разум против трёх агентов

В статье рассматривается проблема «границ агентов» (Agent Boundary Problem) на примере продакшен-системы голосовых интервью. Вместо классического подхода, где каждая роль (технический, системный и поведенческий интервьюер) реализуется как отдельный агент с собственным контекстом и инструментами, автор выбрал архитектуру единой системы рассуждений с тремя персонажами.

Ключевое архитектурное решение: технический интервьюер, системный архитектор и поведенческий интервьюер — это не три разных агента, а одна модель, управляемая детерминированным оркестратором. Это позволяет избежать накладных расходов на сетевые запросы и управление состоянием между независимыми сущностями.

Метрики производительности в продакшене

Использование единой модели позволило достичь высоких показателей скорости отклика. Система работает на базе модели с 20 миллиардами параметров. Замеры показали следующие результаты для Time-to-First-Token (TTFT):

Метрика Значение Комментарий
Медиана TTFT 557 мс Быстрый отклик для большинства запросов
95-й перцентиль TTFT 758 мс Стабильность даже при пиковых нагрузках
Параметры модели 20B Баланс между интеллектом и скоростью

Разделение понятий: Модель, Роля, Оркестратор

Автор подчеркивает важность терминологии. Модель — это движок рассуждений. Роля (Persona) меняет поведение движка (инструкции, тон, критерии оценки) без изменения структуры. Оркестратор контролирует рабочий процесс. Создание нового агента требует нового контекста, набора инструментов и сетевого хопа, что дорого. Переключение роли — это просто правка промпта.

Почему это важно для разработчиков

  • Снижение сложности: Единое состояние сессии (кандидат, описание вакансии, предыдущие ответы) доступно всем «ролям» мгновенно.
  • Экономия ресурсов: Отсутствие необходимости в межагентной коммуникации и дублировании контекста.
  • Гибкость: Изменение логики перехода между этапами требует лишь редактирования конечного автомата оркестратора, а не перестройки архитектуры агентов.

Этот подход подтверждает тезис Microsoft Cloud Adoption Framework: различные роли (планировщик, исполнитель, ревьюер) не всегда оправдывают создание мультиагентной системы, если одна модель с контекстно-зависимыми политиками может справиться с задачей эффективнее.

Источник: Towards AI pub ↗