От общих слов к поведенческим профилям
Традиционные рекомендательные системы часто жертвуют объяснимостью ради точности, а симуляторы пользователей игнорируют реальные данные. Команда исследователей (Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn) представила Large Behavior Model (LBM) — «цифровой двойник» покупателя, который понимает логику принятия решений через призму истории покупок. В основе подхода лежит формула «Личность-Среда» (Person-Environment), где состояние клиента описывается поведенческим профилем, а контекст товаров извлекается через RAG (Retrieval-Augmented Generation).
Технология обучения: от вербализации до RL
Модель не просто классифицирует данные, она «проговаривает» поведение. Процесс обучения LBM состоит из трех этапов:
:- Continued Pre-training: дообучение на вербализованных поведенческих данных (текстовое описание истории покупок).
- Supervised Fine-Tuning (SFT): настройка на генерацию решений (выбор товара).
- Reinforcement Learning (RL): использование верифицируемых вознаграждений для калибровки, чтобы модель опиралась на факты из истории, а не на общие языковые паттерны.
Результаты: LBM против General-Purpose LLM
Оценка проводилась на задачах предсказания покупок, дискриминации сложных негативных примеров (hard-negative discrimination), завершения корзины, реакции на промоакции и кросс-доменного использования ваучеров. LBM стабильно превосходит передовые общие языковые модели (GPT-4, Claude и аналоги) в индустриальных розничных задачах.
| Задача | Ключевое преимущество LBM |
|---|---|
| Предсказание покупок | Высокая точность за счет учета контекста истории |
| Реакция на промо | Лучшее понимание мотивации скидок |
| Zero-shot transfer | Эффективный перенос между разными ритейлерами |
| Объяснимость | Опора на явные поведенческие доказательства (Evidence-based) |
Почему это важно для бизнеса
Абляционные исследования показали, что именно дообучение (pre-training) на поведенческих данных является главным драйвером обобщения. Использование RAG на этапах обучения и инференса критически важно для точности. LBM доказывает, что поведенческие знания, закодированные в транзакционных историях, могут быть эффективно усвоены языковыми моделями, создавая масштабируемую основу для симуляции поведения клиентов без необходимости собирать новые данные.
Источник: arXiv cs.AI ↗
