Исследования14 июля 2026 г., 07:16 МСК🤖 Auto

FSI: Как формат промпта меняет оценки LLM на 30x

Исследование Deep Pankajbhai Mehta показывает, что выбор обертки промпта (wrapper) критически влияет на точность LLM, внося разброс результатов до 30 раз. Представлены метрики FSI и PSI для оценки устойчивости моделей.

Баннер новости 3511

Проблема «невидимого» шума в бенчмарках

Промпт-обертки (prompt wrappers) часто различаются лишь форматированием, но, как выяснилось, способны кардинально менять итоговые баллы моделей, переворачивая выводы лидербордов. Автор исследования вводит два новых метрических показателя для оценки этой нестабильности:

  • Format Sensitivity Index (FSI) — диапазон точности (accuracy), вызванный выбором конкретной обертки промпта.
  • Parseability Sensitivity Index (PSI) — диапазон вариативности успешности парсинга ответа (parseability).

Масштаб эксперимента: 140 000 генераций

Для анализа использовался токен-контролируемый протокол. Исследование охватило 140 000 запросов через OpenRouter, 7 задач вопрос-ответ, 5 семейств оберток и 4 инструктивные модели от 7B до 72B параметров. Ключевая находка: среднее значение FSI варьируется более чем в 30 раз в зависимости от модели. Основная причина таких скачков — сбои в соблюдении схемы (compliance failures).

Статистическая хрупкость без учета FSI

Регрессионный анализ с фиксированными эффектами показал, что способность модели к парсингу ответа остается сильным предиктором точности даже после контроля за задачей, моделью и типом обертки. Автор утверждает, что отчетность об точности без учета дисперсии обертки и соблюдения схемы статистически ненадежна.

Сводные данные по чувствительности

Ниже представлена структура метрик, используемых для оценки устойчивости LLM к изменениям формата промпта:

Метрика Аббревиатура Что измеряет Ключевой вывод
Format Sensitivity Index FSI Диапазон изменения точности (accuracy) из-за выбора обертки Разброс значений превышает 30x между разными моделями
Parseability Sensitivity Index PSI Диапазон вариативности успешности парсинга ответа Сильно коррелирует с итоговой точностью (predictor of accuracy)
Объем данных - Количество сгенерированных ответов 140,000 запросов через OpenRouter
Диапазон моделей - Количество параметров в LLM От 7B до 72B параметров

Практические рекомендации

Исследование дает практические рекомендации как для проведения бенчмарков, так и для развертывания систем с структурированным выводом (structured-output). Игнорирование FSI и PSI при тестировании может привести к ложным выводам о превосходстве одной модели над другой, когда разница обусловлена лишь синтаксисом промпта, а не реальными способностями модели.

Источник: arXiv cs.AI ↗