Исследования7 сентября 2026 г., 23:16 МСК🤖 Auto

LLM провалили тест на понимание китайского сарказма: новый бенчмарк EMNLP 2026

Исследователи представили первый крупный бенчмарк для оценки способности LLM понимать скрытый смысл и иронию в китайских соцсетях. Лучшие модели достигли лишь 81% точности, уступая людям.

Баннер новости 6966

Проблема: контекст важнее слов

Китайские онлайн-комментарии часто строятся на непрямых намёках, играх слов и социальном подтексте, который невозможно расшифровать без знания культурного контекста. Существующие тесты для LLM слишком упрощены: они проверяют знание заученных прагматических категорий, а не способность модели «прочувствовать» реальную ситуацию общения. Авторы работы из arXiv (принято в EMNLP 2026) решили это упущение, создав датасет, имитирующий живую дискуссию.

Методология: 200 000 записей и 4 735 тестов

Команда исследователей (Shiwei Hong, Junjie Ma и др.) проанализировала более 200 000 публичных записей из китайских социальных сетей. На их основе был сформирован набор из 4 735 человеко-валидированных диагностических элементов. Каждый элемент — это пара: целевой комментарий и восстановленный предыдущий контекст, а также plausible misreadings (правдоподобные, но неверные интерпретации). Задача моделей — выбрать единственно верное социальное значение комментария в данном контексте.

Результаты: разрыв с человеком

В исследовании участвовали восемь современных LLM. Тестирование проводилось в режиме «leave-writer-out» (модели не видели данных от авторов, создавших вопросы), чтобы исключить утечку информации. Результаты показали, что, несмотря на прогресс, модели всё ещё плохо различают тонкие механизмы иронии и шуток.

Метрика / Модель Точность (Accuracy) Примечание
Человеческий базовый уровень 90.8% Референс для сравнения
Лучшая LLM (топ-1) 81.42% Leave-writer-out accuracy
Средний результат (8 моделей) 68.70% Среднее арифметическое всех участников

Почему это важно

Анализ ошибок показал, что модели часто верно определяют общий тон (например, «это ирония»), но ошибаются в определении механизма или взаимодейственного хода (interactional move). То есть бот понимает, что его дразнят, но не понимает, почему именно и какую социальную функцию выполняет ответ. Для разработчиков чат-ботов и сервисов поддержки это критично: ошибка в прагматике воспринимается пользователями как грубость или некомпетентность, даже если лексически ответ верен.

Источник: arXiv cs.CL ↗