Исследования7 августа 2026 г., 01:18 МСК🤖 Auto

A/B Agent: Автономная оптимизация рекомендаций с ростом GMV на 4,8%

Исследователи представили A/B Agent — самообучающуюся систему для автоматизации A/B-тестирования в рекомендательных системах, обеспечившую рост GMV на 4,829% в реальном проекте.

Баннер новости 5255

Проблема ручного тюнинга стратегий

В индустриальных рекомендательных системах итерация стратегий критически зависит от масштабного A/B-тестирования. Традиционный процесс требует от экспертов ручного проектирования стратегий, настройки экспериментов, анализа результатов и корректировки параметров. Это трудоемкий и длительный процесс. Кроме того, знания из исторических экспериментов часто фрагментированы, что затрудняет их системное использование. Существующие RAG-агенты лишь частично решают эту проблему, организуя опыт плоским образом и игнорируя иерархические связи между бизнес-сценариями, этапами рекомендаций и объектами оптимизации.

Архитектура A/B Agent

Для решения этих ограничений команда разработала A/B Agent — замкнутый цикл агента для оптимизации стратегий. Фреймворк состоит из трех ключевых компонентов:

  • Организация знаний: Исторические стратегии структурируются в иерархическое дерево опыта (Experience Tree).
  • Генерация стратегий: Используется многопутевой Tree-RAG для извлечения переносимых доказательств и генерации исполняемых стратегий, aware к целевым показателям.
  • Самоэволюция: Агент непрерывно анализирует онлайн-фидбек A/B-тестов, автономно настраивает параметры и обновляет дерево опыта для постоянного улучшения.

Результаты внедрения

Система прошла extensive offline и online оценки. Ключевым результатом стало внедрение в реальную систему рекомендаций коротких видео в электронной коммерции. A/B Agent продемонстрировал значительное улучшение бизнес-метрик при сохранении всех защитных показателей (guardrail metrics).

Метрика Результат / Описание
Рост GMV +4,829%
Guardrail Metrics Все показатели сохранили положительную динамику / не ухудшились
Тип системы Short-video e-commerce recommendation

Значение для индустрии

Представленный подход демонстрирует переход от статического RAG к динамическим самообучающимся агентам. Способность системы не только извлекать знания, но и обновлять их на основе последовательных A/B-фидбеков, позволяет преодолеть ограничения плоской организации данных и обеспечивает кросс-сценарный перенос знаний, что критически важно для сложных промышленных рекомендательных систем.

Источник: arXiv cs.AI ↗