Трелема автономности: почему LLM-агенты ломают рекомендательные системы
Развертывание больших языковых моделей (LLM) в промышленных рекомендательных системах (RecSys) сталкивается с фундаментальной проблемой, которую авторы называют "autonomy-determinism-efficiency trilemma" (трелема автономности-детерминизма-эффективности). Полная автономия агента позволяет ему интерпретировать намерения оператора и писать код, но это угрожает детерминизму (соблюдению схем данных, отсутствием галлюцинаций в compliance-путях) и эффективности (скорости выполнения).
Ключевая идея RecSys Factory заключается в том, чтобы ограничить автономность LLM-агента точками принятия решений, а не всем конвейером обработки данных. Агенты не управляют процессом целиком, а действуют в строго заданных рамках внутри предварительно согласованных пайплайнов.
Архитектура: нулевое потребление CPU в ожидании
Платформа спроектирована с учетом специфики распределенных вычислений (Spark, GPU). Архитектура декомпозирует время выполнения на три источника событий, исходящих от хоста:
- Claude Code Stop hooks: точки остановки для интеграции с LLM.
- Корпоративные IM-webhooks: уведомления через внутренние мессенджеры.
- API планировщика рабочих процессов: управление задачами.
Это позволяет платформе не иметь долгоживущих демонов в фазе ожидания. Система потребляет 0% CPU в 94% времени простоя, которое тратится на ожидание завершения тяжелых Spark-задач или GPU-инференса.
Экосистема навыков и "PitfallStore"
Для контроля качества решений агентов создана экосистема из 29 файлов навыков (общий объем кода — 8 971 строка). Ключевой механизм безопасности — механическая компиляция таблиц с типичными ошибками (pitfalls) каждого навыка в единый PitfallStore, содержащий 400 записей. Это ограничивает автономность агента "связанными типизированными поверхностями решений", предотвращая выход за пределы допустимых сценариев.
Результаты 78-дневного деплоя в Tencent
Платформа была развернута в течение 78 дней на трех различных бизнес-линиях Tencent с разными семантиками меток, топологиями A/B-тестирования и профилями операторов. Основные метрики эффективности:
| Метрика | Значение | Примечание |
|---|---|---|
| Длительность деплоя | 78 дней | Три гетерогенные бизнес-линии |
| Количество диспетчеризаций CLI | 1 624 | Запуски инструментов через интерфейс |
| Общий успех (Success Rate) | 78,6% | Успешное выполнение задач |
| Пилотный запуск (Human-in-the-loop) | 8 дней, 16 запусков | Протокол карточек для аудита решений |
| Потребление ресурсов в ожидании | 0% CPU | 94% времени простоя системы |
Человек в контуре: протокол карточек
На границе диагностики и исполнения сохранен человек (Human-in-the-loop). Используется протокол карточек (card protocol), который действует как примитив аудита: он валидирует схему, является идемпотентным и позволяет воспроизводить действия. Это обеспечивает нулевые галлюцинации в compliance-путях и позволяет операторам контролировать критические решения, не блокируя весь процесс.
Источник: arXiv cs.AI ↗
