Проблема ручного тюнинга стратегий
В индустриальных рекомендательных системах итерация стратегий критически зависит от масштабного A/B-тестирования. Традиционный процесс требует от экспертов ручного проектирования стратегий, настройки экспериментов, анализа результатов и корректировки параметров. Это трудоемкий и длительный процесс. Кроме того, знания из исторических экспериментов часто фрагментированы, что затрудняет их системное использование. Существующие RAG-агенты лишь частично решают эту проблему, организуя опыт плоским образом и игнорируя иерархические связи между бизнес-сценариями, этапами рекомендаций и объектами оптимизации.
Архитектура A/B Agent
Для решения этих ограничений команда разработала A/B Agent — замкнутый цикл агента для оптимизации стратегий. Фреймворк состоит из трех ключевых компонентов:
- Организация знаний: Исторические стратегии структурируются в иерархическое дерево опыта (Experience Tree).
- Генерация стратегий: Используется многопутевой Tree-RAG для извлечения переносимых доказательств и генерации исполняемых стратегий, aware к целевым показателям.
- Самоэволюция: Агент непрерывно анализирует онлайн-фидбек A/B-тестов, автономно настраивает параметры и обновляет дерево опыта для постоянного улучшения.
Результаты внедрения
Система прошла extensive offline и online оценки. Ключевым результатом стало внедрение в реальную систему рекомендаций коротких видео в электронной коммерции. A/B Agent продемонстрировал значительное улучшение бизнес-метрик при сохранении всех защитных показателей (guardrail metrics).
| Метрика | Результат / Описание |
|---|---|
| Рост GMV | +4,829% |
| Guardrail Metrics | Все показатели сохранили положительную динамику / не ухудшились |
| Тип системы | Short-video e-commerce recommendation |
Значение для индустрии
Представленный подход демонстрирует переход от статического RAG к динамическим самообучающимся агентам. Способность системы не только извлекать знания, но и обновлять их на основе последовательных A/B-фидбеков, позволяет преодолеть ограничения плоской организации данных и обеспечивает кросс-сценарный перенос знаний, что критически важно для сложных промышленных рекомендательных систем.
Источник: arXiv cs.AI ↗
