Исследования3 июля 2026 г., 21:17 МСК🤖 Auto

Ловушка в промпте: как цифры искажают оценку LLM

Исследование Dekun Yang (arXiv:2607.01240) доказывает, что указание количества ошибок в промпте искусственно завышает метрики F1 у LLM без улучшения качества поиска ошибок.

Баннер новости 2872

Проблема F1 Inflation

Традиционная метрика F1, основанная на подсчете совпадений, часто используется как прокси-индикатор качества обнаружения ошибок языковыми моделями. Однако новое исследование выявляет серьезный дефект: F1 Inflation (инфляция F1). Модель может показывать резкий рост метрики, фактически не улучшая локализацию ошибок (span localization). Это создает ложное впечатление о высокой точности системы.

Методология ErrorBench

Автор представил протокол ErrorBench — контролируемый стресс-тест, оценивающий влияние «фрейминга» промпта. Эксперимент проводился на 4290 ответах от 6 современных LLM (включая GPT, Claude, Gemini) на базе 143 текстов из набора CoNLL-2014. Ключевое условие: модели сравнивались в состоянии «слепоты» к количеству ошибок и при наличии «якоря» (указанного числа ошибок в промпте).

Ключевые цифры и результаты

Использование промптов с числовым якорем привело к значительному искажению результатов. Разница между «слепым» и «якорным» режимами наглядно демонстрирует эффект анкерирования:

Метрика Изменение (Blind-to-Anchored) Примечание
Count-F1 (CoNLL-2014 M2) +0.79 Максимальный прирост
Count-F1 (Strict Matching) +0.96 Максимальный прирост
ERRANT F0.5 (Multi-reference) +0.04 Средний прирост по 6 моделям (100 passages)

Воспроизведение теста через официальный пайплайн ERRANT 3.0.0 подтвердило паттерн: прирост Count-F1 составил +0.21, тогда как более надежная метрика ERRANT F0.5 выросла лишь на +0.04. Это доказывает, что стандартный F1 не отражает реального улучшения качества.

Реакция моделей

Разные семейства моделей реагируют на инструкцию по-разному. Системы, ориентированные на строгое соблюдение инструкций (GPT, Claude), генерировали значительно больше ответов (over-generation), пытаясь угадать число. Семейство Gemini демонстрировало меньшую реакцию на этот стресс-тест.

Рекомендации для индустрии

Авторы настоятельно рекомендуют:

  • Исключить предзаполненные счетчики ошибок из промптов при оценке LLM.
  • Всегда сообщать метрики, учитывающие локализацию (span-aware), а не только подсчет совпадений.
  • Критически относиться к отчетам, основанным исключительно на count-based F1.

Источник: arXiv cs.CL ↗