Проблема: контекст важнее слов
Китайские онлайн-комментарии часто строятся на непрямых намёках, играх слов и социальном подтексте, который невозможно расшифровать без знания культурного контекста. Существующие тесты для LLM слишком упрощены: они проверяют знание заученных прагматических категорий, а не способность модели «прочувствовать» реальную ситуацию общения. Авторы работы из arXiv (принято в EMNLP 2026) решили это упущение, создав датасет, имитирующий живую дискуссию.
Методология: 200 000 записей и 4 735 тестов
Команда исследователей (Shiwei Hong, Junjie Ma и др.) проанализировала более 200 000 публичных записей из китайских социальных сетей. На их основе был сформирован набор из 4 735 человеко-валидированных диагностических элементов. Каждый элемент — это пара: целевой комментарий и восстановленный предыдущий контекст, а также plausible misreadings (правдоподобные, но неверные интерпретации). Задача моделей — выбрать единственно верное социальное значение комментария в данном контексте.
Результаты: разрыв с человеком
В исследовании участвовали восемь современных LLM. Тестирование проводилось в режиме «leave-writer-out» (модели не видели данных от авторов, создавших вопросы), чтобы исключить утечку информации. Результаты показали, что, несмотря на прогресс, модели всё ещё плохо различают тонкие механизмы иронии и шуток.
| Метрика / Модель | Точность (Accuracy) | Примечание |
|---|---|---|
| Человеческий базовый уровень | 90.8% | Референс для сравнения |
| Лучшая LLM (топ-1) | 81.42% | Leave-writer-out accuracy |
| Средний результат (8 моделей) | 68.70% | Среднее арифметическое всех участников |
Почему это важно
Анализ ошибок показал, что модели часто верно определяют общий тон (например, «это ирония»), но ошибаются в определении механизма или взаимодейственного хода (interactional move). То есть бот понимает, что его дразнят, но не понимает, почему именно и какую социальную функцию выполняет ответ. Для разработчиков чат-ботов и сервисов поддержки это критично: ошибка в прагматике воспринимается пользователями как грубость или некомпетентность, даже если лексически ответ верен.
Источник: arXiv cs.CL ↗
