Проблема однопользовательского подхода
Существующие системы эмоциональной поддержки (Emotional Support Conversation, ESC) фокусируются на взаимодействии «один на один» и игнорируют межличностные связи. В реальных сценариях, таких как семейные консультации или парные терапии, эмоции одного участника напрямую зависят от отношений с другими. Исследователи из группы Haichuan Hu и коллег создали RESCUE-BENCH — первый бенчмарк, оценивающий способность LLM понимать и использовать динамику отношений в многопользовательских диалогах.
Масштаб данных: от видео до аннотаций
Датасет RESCUE (Relation-aware Emotional Support Conversation Understanding and Evaluation Benchmark) построен на реальных интервью пар и семей. Это не просто тексты, а мультимодальные данные с глубокой разметкой социально-эмоциональных динамики. Ключевые метрики датасета:
- 191 уникальный образец диалога.
- 7,079 аннотированных реплик (turns).
- 1,064.8 минут видеоматериала.
Данные позволяют оценивать не только содержание речи, но и невербальные сигналы и контекст отношений, что критически важно для эмпатичного ответа.
Две ключевые способности и шесть задач
Бенчмарк оценивает модели по двум ядрам: Relational Understanding (понимание отношений) и Relation-Sensitive Support (поддержка с учетом отношений). Эксперименты с десятью крупными языковыми моделями выявили четкое разделение способностей:
| Категория задачи | Примеры задач | Результат LLM |
|---|---|---|
| Локальные эмоциональные сигналы | Распознавание эмоций в отдельной реплике | Относительно высокая точность |
| Интенсивные реляционные задачи | Предсказание паттернов отношений, точек зрения, стратегий поддержки | Значительное снижение качества |
Модели успешно справляются с задачами, требующими анализа локальных эмоциональных маркеров, но «спотыкаются» на задачах, требующих понимания долгосрочной динамики отношений между участниками (например, предсказание, как изменится реакция партнера через 5 минут разговора).
Почему это важно для индустрии
Результаты исследования, принятого к публикации в AACL Findings, демонстрируют фундаментальный пробел в текущих архитектурах LLM. Современные модели не способны моделировать сложные межличностные связи, необходимые для реальной психологической поддержки. Это означает, что внедрение AI-терапевтов в сценариях семейной терапии или групповой психологии требует не просто улучшения контекстного окна, а новых архитектурных решений для учета реляционного контекста.
Вывод
RESCUE-BENCH становится новым стандартом для оценки эмпатии AI. Он показывает, что «понимание эмоций» — это лишь половина дела; настоящая сложность заключается в понимании того, как эти эмоции связаны с историей отношений между людьми.
Источник: arXiv cs.AI ↗
