Исследования11 сентября 2026 г., 19:19 МСК🤖 Auto

RESCUE-BENCH: LLM провалили тест на эмпатию в сложных семейных спорах

Новый бенчмарк RESCUE-BENCH показал, что современные LLM не умеют учитывать динамику отношений в многопользовательских диалогах, теряя в эффективности поддержки.

Баннер новости 7290

Проблема однопользовательского подхода

Существующие системы эмоциональной поддержки (Emotional Support Conversation, ESC) фокусируются на взаимодействии «один на один» и игнорируют межличностные связи. В реальных сценариях, таких как семейные консультации или парные терапии, эмоции одного участника напрямую зависят от отношений с другими. Исследователи из группы Haichuan Hu и коллег создали RESCUE-BENCH — первый бенчмарк, оценивающий способность LLM понимать и использовать динамику отношений в многопользовательских диалогах.

Масштаб данных: от видео до аннотаций

Датасет RESCUE (Relation-aware Emotional Support Conversation Understanding and Evaluation Benchmark) построен на реальных интервью пар и семей. Это не просто тексты, а мультимодальные данные с глубокой разметкой социально-эмоциональных динамики. Ключевые метрики датасета:

  • 191 уникальный образец диалога.
  • 7,079 аннотированных реплик (turns).
  • 1,064.8 минут видеоматериала.

Данные позволяют оценивать не только содержание речи, но и невербальные сигналы и контекст отношений, что критически важно для эмпатичного ответа.

Две ключевые способности и шесть задач

Бенчмарк оценивает модели по двум ядрам: Relational Understanding (понимание отношений) и Relation-Sensitive Support (поддержка с учетом отношений). Эксперименты с десятью крупными языковыми моделями выявили четкое разделение способностей:

Категория задачи Примеры задач Результат LLM
Локальные эмоциональные сигналы Распознавание эмоций в отдельной реплике Относительно высокая точность
Интенсивные реляционные задачи Предсказание паттернов отношений, точек зрения, стратегий поддержки Значительное снижение качества

Модели успешно справляются с задачами, требующими анализа локальных эмоциональных маркеров, но «спотыкаются» на задачах, требующих понимания долгосрочной динамики отношений между участниками (например, предсказание, как изменится реакция партнера через 5 минут разговора).

Почему это важно для индустрии

Результаты исследования, принятого к публикации в AACL Findings, демонстрируют фундаментальный пробел в текущих архитектурах LLM. Современные модели не способны моделировать сложные межличностные связи, необходимые для реальной психологической поддержки. Это означает, что внедрение AI-терапевтов в сценариях семейной терапии или групповой психологии требует не просто улучшения контекстного окна, а новых архитектурных решений для учета реляционного контекста.

Вывод

RESCUE-BENCH становится новым стандартом для оценки эмпатии AI. Он показывает, что «понимание эмоций» — это лишь половина дела; настоящая сложность заключается в понимании того, как эти эмоции связаны с историей отношений между людьми.

Источник: arXiv cs.AI ↗