Проблема «невидимого» шума в бенчмарках
Промпт-обертки (prompt wrappers) часто различаются лишь форматированием, но, как выяснилось, способны кардинально менять итоговые баллы моделей, переворачивая выводы лидербордов. Автор исследования вводит два новых метрических показателя для оценки этой нестабильности:
- Format Sensitivity Index (FSI) — диапазон точности (accuracy), вызванный выбором конкретной обертки промпта.
- Parseability Sensitivity Index (PSI) — диапазон вариативности успешности парсинга ответа (parseability).
Масштаб эксперимента: 140 000 генераций
Для анализа использовался токен-контролируемый протокол. Исследование охватило 140 000 запросов через OpenRouter, 7 задач вопрос-ответ, 5 семейств оберток и 4 инструктивные модели от 7B до 72B параметров. Ключевая находка: среднее значение FSI варьируется более чем в 30 раз в зависимости от модели. Основная причина таких скачков — сбои в соблюдении схемы (compliance failures).
Статистическая хрупкость без учета FSI
Регрессионный анализ с фиксированными эффектами показал, что способность модели к парсингу ответа остается сильным предиктором точности даже после контроля за задачей, моделью и типом обертки. Автор утверждает, что отчетность об точности без учета дисперсии обертки и соблюдения схемы статистически ненадежна.
Сводные данные по чувствительности
Ниже представлена структура метрик, используемых для оценки устойчивости LLM к изменениям формата промпта:
| Метрика | Аббревиатура | Что измеряет | Ключевой вывод |
|---|---|---|---|
| Format Sensitivity Index | FSI | Диапазон изменения точности (accuracy) из-за выбора обертки | Разброс значений превышает 30x между разными моделями |
| Parseability Sensitivity Index | PSI | Диапазон вариативности успешности парсинга ответа | Сильно коррелирует с итоговой точностью (predictor of accuracy) |
| Объем данных | - | Количество сгенерированных ответов | 140,000 запросов через OpenRouter |
| Диапазон моделей | - | Количество параметров в LLM | От 7B до 72B параметров |
Практические рекомендации
Исследование дает практические рекомендации как для проведения бенчмарков, так и для развертывания систем с структурированным выводом (structured-output). Игнорирование FSI и PSI при тестировании может привести к ложным выводам о превосходстве одной модели над другой, когда разница обусловлена лишь синтаксисом промпта, а не реальными способностями модели.
Источник: arXiv cs.AI ↗
