Исследования13 августа 2026 г., 16:18 МСК🤖 Auto

RecSys Factory: Как Tencent ограничил автономность LLM-агентов для промышленного рекоммендерного цикла

Исследователи Tencent представили платформу RecSys Factory, которая решает конфликт между автономностью, детерминизмом и эффективностью в промышленных рекомендательных системах, достигнув 78,6% успеха в 1624 запусках.

Баннер новости 5711

Трелема автономности: почему LLM-агенты ломают рекомендательные системы

Развертывание больших языковых моделей (LLM) в промышленных рекомендательных системах (RecSys) сталкивается с фундаментальной проблемой, которую авторы называют "autonomy-determinism-efficiency trilemma" (трелема автономности-детерминизма-эффективности). Полная автономия агента позволяет ему интерпретировать намерения оператора и писать код, но это угрожает детерминизму (соблюдению схем данных, отсутствием галлюцинаций в compliance-путях) и эффективности (скорости выполнения).

Ключевая идея RecSys Factory заключается в том, чтобы ограничить автономность LLM-агента точками принятия решений, а не всем конвейером обработки данных. Агенты не управляют процессом целиком, а действуют в строго заданных рамках внутри предварительно согласованных пайплайнов.

Архитектура: нулевое потребление CPU в ожидании

Платформа спроектирована с учетом специфики распределенных вычислений (Spark, GPU). Архитектура декомпозирует время выполнения на три источника событий, исходящих от хоста:

  • Claude Code Stop hooks: точки остановки для интеграции с LLM.
  • Корпоративные IM-webhooks: уведомления через внутренние мессенджеры.
  • API планировщика рабочих процессов: управление задачами.

Это позволяет платформе не иметь долгоживущих демонов в фазе ожидания. Система потребляет 0% CPU в 94% времени простоя, которое тратится на ожидание завершения тяжелых Spark-задач или GPU-инференса.

Экосистема навыков и "PitfallStore"

Для контроля качества решений агентов создана экосистема из 29 файлов навыков (общий объем кода — 8 971 строка). Ключевой механизм безопасности — механическая компиляция таблиц с типичными ошибками (pitfalls) каждого навыка в единый PitfallStore, содержащий 400 записей. Это ограничивает автономность агента "связанными типизированными поверхностями решений", предотвращая выход за пределы допустимых сценариев.

Результаты 78-дневного деплоя в Tencent

Платформа была развернута в течение 78 дней на трех различных бизнес-линиях Tencent с разными семантиками меток, топологиями A/B-тестирования и профилями операторов. Основные метрики эффективности:

Метрика Значение Примечание
Длительность деплоя 78 дней Три гетерогенные бизнес-линии
Количество диспетчеризаций CLI 1 624 Запуски инструментов через интерфейс
Общий успех (Success Rate) 78,6% Успешное выполнение задач
Пилотный запуск (Human-in-the-loop) 8 дней, 16 запусков Протокол карточек для аудита решений
Потребление ресурсов в ожидании 0% CPU 94% времени простоя системы

Человек в контуре: протокол карточек

На границе диагностики и исполнения сохранен человек (Human-in-the-loop). Используется протокол карточек (card protocol), который действует как примитив аудита: он валидирует схему, является идемпотентным и позволяет воспроизводить действия. Это обеспечивает нулевые галлюцинации в compliance-путях и позволяет операторам контролировать критические решения, не блокируя весь процесс.

Источник: arXiv cs.AI ↗