Суть проблемы: разрыв между адаптацией и убеждением
Классическая персонализация в маркетинге — это двусторонний процесс, где отправитель (sender) и получатель (receiver) имеют независимые цели. Современные LLM устраняют ограничения ретrieve-and-rank систем, генерируя бесконечное число вариантов сообщений. Однако существующие бенчмарки оценивали лишь адаптацию отправителя (когда получатель — тот же пользователь, что и в диалоге), игнорируя реальный вопрос: вызовет ли сгенерированное сообщение нужное действие у третьей стороны?
Авторы работы (Ashutosh Srivastava и соавт.) адаптировали фреймворк Bayesian Persuasion (Kamenica & Gentzkow, 2011) к генеративным агентам, создав тестовую среду, где действия получателей логгируются объективно, а не через субъективные опросы.
SDR-Bench: масштабные данные и жесткие условия
Для тестирования был выпущен публичный корпус SDR-Bench, содержащий 6 279 историй успеха (customer success stories) из 22 отраслей и примерно 200 предприятий. Ключевая особенность бенчмарка — временное ограничение (temporally constrained simulation), которое предотвращает утечку будущих данных и обеспечивает воспроизводимость тестов для любых новых моделей.
Результаты: «Плато персонализации»
Тестирование передовых LLM и агентов глубокого исследования (deep-research agents) выявило устойчивый феномен: персонализация достигла потолка. В когорте компаний из списка Fortune 100 (IT-сектор) ни одна модель не смогла статистически отделить успешные outreach-сообщения от неуспешных. Это означает, что текущие модели не способны гарантированно повышать конверсию за счет персонализации в сложных B2B-сценариях.
| Метрика / Параметр | Значение / Результат | Комментарий |
|---|---|---|
| Размер датасета (SDR-Bench) | 6 279 историй | Покрытие 22 отраслей, ~200 компаний |
| Результат на Fortune 100 Tech | Нет стат. различий | Модели не выделяют успешные рассылки |
| Поле тестирование (Field Deployment) | 48% полезности | Оценка 12 профессиональных sales-представителей |
| Согласие экспертов | Pearson r = 0.82 | Высокая корреляция мнений старших экспертов |
Практическая валидация
Несмотря на провал в автоматическом разделении успешных/неуспешных кейсов, полевое развертывание с участием 12 профессиональных специалистов по продажам показало практическую пользу: 48% сгенерированного контента были оценены как «немедленно полезные». Согласие между старшими экспертами по оценке качества контента достигло коэффициента Пирсона 0.82, что свидетельствует о высокой надежности оценки качества ИИ-генерации людьми.
Значение для индустрии
Авторы публикуют SDR-Arena и SDR-Bench в открытом доступе. Это позволяет исследователям и разработчикам проводить воспроизводимые исследования масштабируемой персонализации, смещая фокус с простой «адаптации стиля» на реальное влияние на поведение получателя.
Источник: arXiv cs.AI ↗
