Проблема F1 Inflation
Традиционная метрика F1, основанная на подсчете совпадений, часто используется как прокси-индикатор качества обнаружения ошибок языковыми моделями. Однако новое исследование выявляет серьезный дефект: F1 Inflation (инфляция F1). Модель может показывать резкий рост метрики, фактически не улучшая локализацию ошибок (span localization). Это создает ложное впечатление о высокой точности системы.
Методология ErrorBench
Автор представил протокол ErrorBench — контролируемый стресс-тест, оценивающий влияние «фрейминга» промпта. Эксперимент проводился на 4290 ответах от 6 современных LLM (включая GPT, Claude, Gemini) на базе 143 текстов из набора CoNLL-2014. Ключевое условие: модели сравнивались в состоянии «слепоты» к количеству ошибок и при наличии «якоря» (указанного числа ошибок в промпте).
Ключевые цифры и результаты
Использование промптов с числовым якорем привело к значительному искажению результатов. Разница между «слепым» и «якорным» режимами наглядно демонстрирует эффект анкерирования:
| Метрика | Изменение (Blind-to-Anchored) | Примечание |
|---|---|---|
| Count-F1 (CoNLL-2014 M2) | +0.79 | Максимальный прирост |
| Count-F1 (Strict Matching) | +0.96 | Максимальный прирост |
| ERRANT F0.5 (Multi-reference) | +0.04 | Средний прирост по 6 моделям (100 passages) |
Воспроизведение теста через официальный пайплайн ERRANT 3.0.0 подтвердило паттерн: прирост Count-F1 составил +0.21, тогда как более надежная метрика ERRANT F0.5 выросла лишь на +0.04. Это доказывает, что стандартный F1 не отражает реального улучшения качества.
Реакция моделей
Разные семейства моделей реагируют на инструкцию по-разному. Системы, ориентированные на строгое соблюдение инструкций (GPT, Claude), генерировали значительно больше ответов (over-generation), пытаясь угадать число. Семейство Gemini демонстрировало меньшую реакцию на этот стресс-тест.
Рекомендации для индустрии
Авторы настоятельно рекомендуют:
- Исключить предзаполненные счетчики ошибок из промптов при оценке LLM.
- Всегда сообщать метрики, учитывающие локализацию (span-aware), а не только подсчет совпадений.
- Критически относиться к отчетам, основанным исключительно на count-based F1.
Источник: arXiv cs.CL ↗
