Исследования24 июля 2026 г., 10:16 МСК🤖 Auto

LLM-персонализация уперлась в потолок: SDR-Bench показал провалы в продажах

Исследование SDR-Bench выявило «плато персонализации» у топовых LLM: модели не могут статистически отличить успешные от провальных продаж, хотя 48% контента признано полезным экспертами.

Баннер новости 4277

Суть проблемы: разрыв между адаптацией и убеждением

Классическая персонализация в маркетинге — это двусторонний процесс, где отправитель (sender) и получатель (receiver) имеют независимые цели. Современные LLM устраняют ограничения ретrieve-and-rank систем, генерируя бесконечное число вариантов сообщений. Однако существующие бенчмарки оценивали лишь адаптацию отправителя (когда получатель — тот же пользователь, что и в диалоге), игнорируя реальный вопрос: вызовет ли сгенерированное сообщение нужное действие у третьей стороны?

Авторы работы (Ashutosh Srivastava и соавт.) адаптировали фреймворк Bayesian Persuasion (Kamenica & Gentzkow, 2011) к генеративным агентам, создав тестовую среду, где действия получателей логгируются объективно, а не через субъективные опросы.

SDR-Bench: масштабные данные и жесткие условия

Для тестирования был выпущен публичный корпус SDR-Bench, содержащий 6 279 историй успеха (customer success stories) из 22 отраслей и примерно 200 предприятий. Ключевая особенность бенчмарка — временное ограничение (temporally constrained simulation), которое предотвращает утечку будущих данных и обеспечивает воспроизводимость тестов для любых новых моделей.

Результаты: «Плато персонализации»

Тестирование передовых LLM и агентов глубокого исследования (deep-research agents) выявило устойчивый феномен: персонализация достигла потолка. В когорте компаний из списка Fortune 100 (IT-сектор) ни одна модель не смогла статистически отделить успешные outreach-сообщения от неуспешных. Это означает, что текущие модели не способны гарантированно повышать конверсию за счет персонализации в сложных B2B-сценариях.

Метрика / Параметр Значение / Результат Комментарий
Размер датасета (SDR-Bench) 6 279 историй Покрытие 22 отраслей, ~200 компаний
Результат на Fortune 100 Tech Нет стат. различий Модели не выделяют успешные рассылки
Поле тестирование (Field Deployment) 48% полезности Оценка 12 профессиональных sales-представителей
Согласие экспертов Pearson r = 0.82 Высокая корреляция мнений старших экспертов

Практическая валидация

Несмотря на провал в автоматическом разделении успешных/неуспешных кейсов, полевое развертывание с участием 12 профессиональных специалистов по продажам показало практическую пользу: 48% сгенерированного контента были оценены как «немедленно полезные». Согласие между старшими экспертами по оценке качества контента достигло коэффициента Пирсона 0.82, что свидетельствует о высокой надежности оценки качества ИИ-генерации людьми.

Значение для индустрии

Авторы публикуют SDR-Arena и SDR-Bench в открытом доступе. Это позволяет исследователям и разработчикам проводить воспроизводимые исследования масштабируемой персонализации, смещая фокус с простой «адаптации стиля» на реальное влияние на поведение получателя.

Источник: arXiv cs.AI ↗