Архитектурный выбор: один разум против трёх агентов
В статье рассматривается проблема «границ агентов» (Agent Boundary Problem) на примере продакшен-системы голосовых интервью. Вместо классического подхода, где каждая роль (технический, системный и поведенческий интервьюер) реализуется как отдельный агент с собственным контекстом и инструментами, автор выбрал архитектуру единой системы рассуждений с тремя персонажами.
Ключевое архитектурное решение: технический интервьюер, системный архитектор и поведенческий интервьюер — это не три разных агента, а одна модель, управляемая детерминированным оркестратором. Это позволяет избежать накладных расходов на сетевые запросы и управление состоянием между независимыми сущностями.
Метрики производительности в продакшене
Использование единой модели позволило достичь высоких показателей скорости отклика. Система работает на базе модели с 20 миллиардами параметров. Замеры показали следующие результаты для Time-to-First-Token (TTFT):
| Метрика | Значение | Комментарий |
|---|---|---|
| Медиана TTFT | 557 мс | Быстрый отклик для большинства запросов |
| 95-й перцентиль TTFT | 758 мс | Стабильность даже при пиковых нагрузках |
| Параметры модели | 20B | Баланс между интеллектом и скоростью |
Разделение понятий: Модель, Роля, Оркестратор
Автор подчеркивает важность терминологии. Модель — это движок рассуждений. Роля (Persona) меняет поведение движка (инструкции, тон, критерии оценки) без изменения структуры. Оркестратор контролирует рабочий процесс. Создание нового агента требует нового контекста, набора инструментов и сетевого хопа, что дорого. Переключение роли — это просто правка промпта.
Почему это важно для разработчиков
- Снижение сложности: Единое состояние сессии (кандидат, описание вакансии, предыдущие ответы) доступно всем «ролям» мгновенно.
- Экономия ресурсов: Отсутствие необходимости в межагентной коммуникации и дублировании контекста.
- Гибкость: Изменение логики перехода между этапами требует лишь редактирования конечного автомата оркестратора, а не перестройки архитектуры агентов.
Этот подход подтверждает тезис Microsoft Cloud Adoption Framework: различные роли (планировщик, исполнитель, ревьюер) не всегда оправдывают создание мультиагентной системы, если одна модель с контекстно-зависимыми политиками может справиться с задачей эффективнее.
Источник: Towards AI pub ↗
