Исследования5 августа 2026 г., 02:17 МСК🤖 Auto

Averaging Bias: Почему человеческие оценки верности суммаризации обманчивы

Исследование выявило систематическую ошибку в бенчмарках верности (faithfulness): аннотаторы помечают суммаризации как «верные», игнорируя локальные фактические ошибки, если большинство предложений корректны.

Баннер новости 5087

Проблема строгого правила conjunctive

Оценка верности (faithfulness) текстовой суммаризации традиционно опирается на строгое логическое правило: суммаризация считается верной только тогда, когда каждое её предложение поддерживается исходным документом. Согласно этой логике, наличие хотя бы одного неподтвержденного предложения делает всю суммаризацию «неверной» (unfaithful). Однако большинство существующих бенчмарков собирает только одну глобальную оценку (label) для всей суммаризации от человека-аннотатора, не фиксируя детали по каждому предложению.

Гипотеза и методология: Averaging Bias

Авторы работы (Huajian Zhang, Yiyang Feng, Jiawei Zhou) выдвинули гипотезу, что аннотаторы подсознательно применяют правило усреднения: они считают суммаризацию верной, если большинство предложений корректны, а не если все они корректны. Для проверки этой гипотезы исследователи использовали пять больших языковых моделей (LLM) в роли судей для оценки каждого предложения отдельно (per-sentence raters) на четырех широко используемых бенчмарках верности.

Ключевые результаты

Анализ показал, что глобальные человеческие оценки лучше коррелируют со средним значением оценок LLM-судей по отдельным предложениям, чем с реализацией строгого conjunctive правила. Ручная проверка подтвердила, что значительная часть суммаризаций, помеченных людьми как «верные», содержит реальные локальные фактические ошибки. Это явление авторы назвали Averaging Bias (Смещение усреднения).

Аспект оценки Строгий подход (Теория) Реальность (Averaging Bias)
Критерий верности Все предложения должны быть поддержаны источником (AND-логика) Большинство предложений поддерживают источник (усреднение)
Результат при ошибке Одна ошибка = вся суммаризация неверна Ошибки игнорируются, если «фон» корректен
Корреляция с LLM Низкая (строго по логике) Высокая (со средним баллом по предложениям)

Почему это важно для индустрии

Результаты исследования ставят под сомнение надежность существующих метрик верности, на которых обучаются и оцениваются современные LLM. Если человеческие аннотации содержат измеримое смещение, то модели, оптимизирующиеся под эти данные, могут учиться «халтурить» — генерировать суммаризации с локальными галлюцинациями, которые люди все равно будут считать приемлемыми. Авторы призывают к разработке более структурированных дизайнов для сбора человеческих аннотаций, чтобы обеспечить доверие к оценкам качества суммаризации.

Источник: arXiv cs.CL ↗