Проблема мультиобъективной оптимизации
Современные рекомендательные системы (RS) все чаще используют генеративное моделирование для создания упорядоченных списков (слэтов). Однако на практике важно учитывать не только релевантность, но и дополнительные ограничения: атрибуты товаров, справедливость (fairness) и другие бизнес-метрики. Существующие подходы либо применяют постобработку, игнорируя последовательную природу генерации, либо требуют сложного дообучения моделей, что непрактично в масштабах Google.
Решение: Inference-time слой
Команда во главе с Дмитрием Муром (Dmitrii Moor) предложила легковесный слой декодирования, работающий на этапе инференса. Метод формулирует выбор элементов как задачу онлайн-оптимизации с ограничениями. Алгоритм динамически регулирует компромисс между релевантностью и вспомогательными целями, используя «остаточную свободу» (constraint slack) — то, сколько еще ограничений можно выполнить в оставшейся части слэта.
Ключевые метрики и результаты
Метод был протестирован в реальных условиях на крупном сервисе рекомендаций. Результаты A/B-теста показали значимое улучшение баланса целей без ущерба для пользовательского опыта:
| Метрика | Результат | Значение |
|---|---|---|
| Улучшение вспомогательных целей | +1.8% | Без снижения удовлетворенности пользователей |
| Требования к переобучению | Отсутствуют | Модель остается неизменной |
| Теоретические гарантии | Есть | Ограничения нарушения и регрета |
Почему это важно
Предложенный подход Stochastic Primal-Dual Decoding позволяет внедрять сложные бизнес-правила в генеративные модели «на лету». Это устраняет необходимость дорогостоящего переобучения базовых моделей под каждую новую метрику, делая системы рекомендаций более гибкими и адаптивными к меняющимся требованиям бизнеса.
Источник: arXiv cs.AI ↗