Проблема «слепых зон» в атрибуции
В электронной коммерции и онлайн-рекламе критически важно понимать, какие именно шаги (touchpoints) привели пользователя к покупке. Традиционные методы опираются на эвристики на основе коллаборативной фильтрации, которые работают по жестким правилам. Однако исследователи из команды Jinqi Wu, Shuodian Yu, Lei Zhang и других (12 авторов) обнаружили значительный семантический разрыв: существующие правила часто игнорируют неявно связанные, но семантически релевантные действия пользователя.
Авторы провели аннотирование данных человеком, чтобы выявить эти «скрытые» точки контакта, которые алгоритмы пропускают, и систематически оценили способность LLM (Large Language Models) идентифицировать такие ассоциации.
Результаты оценки LLM
Эксперимент показал, что LLM эффективно выявляют существенную долю скрыто связанных точек контакта. Однако, несмотря на успехи, в производительности выбора остается значительный потенциал для улучшения. Исследователи проанализировали влияние различных стратегий промптов (prompting strategies) и выбора базовых моделей на точность идентификации, что дает новую дорожную карту для перехода от механического сопоставления правил к семантическому рассуждению, выровненному с человеческим восприятием.
Практическая польза: рост CVR-моделей
Самое важное открытие — практическое применение. Авторы использовали метки конверсий, атрибутированные LLM, для улучшения обучения промышленных моделей прогнозирования конверсий (CVR — Conversion Rate). Это привело к значительному росту производительности в офлайн-тестах, доказывая, что семантический анализ путей клиента может напрямую влиять на бизнес-метрики.
Ключевые выводы для индустрии
- Семантика важнее правил: LLM понимают контекст лучше, чем жесткие эвристики, выявляя неочевидные связи между действиями пользователя.
- Улучшение CVR: Интеграция LLM-атрибуции в обучение рекомендательных систем дает измеримый прирост точности.
- Направление развития: Будущее атрибуции лежит в области семантического рассуждения, а не просто статистического совпадения.
Работа принята к публикации в качестве короткой статьи на конференции CIKM 2026 и доступна в preprint на arXiv (2608.28649).
Источник: arXiv cs.CL ↗
