Исследования13 августа 2026 г., 08:18 МСК🤖 Auto

Провал метрики Realism Win Rate: порядок слов ломает оценку реалистичности LLM

Исследование SPAR показало, что популярный метод оценки «осознанности» моделей (Eval Awareness) ненадежен: LLM-судьи дают разные оценки одним и тем же текстам в зависимости от их позиции в паре.

Баннер новости 5672

Суть проблемы: хрупкость метрики

Исследователи Achu Menon и Santiago Aranguri (программа SPAR) проанализировали метрику Realism Win Rate, используемую для оценки того, насколько синтетические диалоги (генерируемые для тестов) похожи на реальные разговоры. Метрика предполагает, что если LLM-судья чаще выбирает тестовый диалог как «более реалистичный» по сравнению с реальным, то тесты слишком реалистичны и модель может «запомнить» их.

Оказалось, что эта метрика критически зависит от порядка подачи данных. Судьи систематически отдают предпочтение тексту, стоящему вторым в паре сравнения, что делает результаты измерений искаженными.

Ключевые цифры и предвзятость позиций

В эксперименте использовались модели Claude Sonnet 4.5 и Opus 4.5 в роли судей (с 2000 токенами на размышления). Синтетические диалоги генерировались моделью Petri. Результаты показали сильную позицию-зависимость:

Модель-судья Эффект позиции (разница в %) Инфляция Realism Win Rate (по сравнению с абсолютными оценками)
Claude Sonnet 4.5 30–43 п.п. (преимущество второго места) 28–45 п.п. (вместо ожидаемых 0%)
Claude Opus 4.5 7–9 п.п. (преимущество второго места) 4–7 п.п. (вместо ожидаемых 0%)

Цифры показывают, что при попарном сравнении судьи «видят» нереалистичность там, где она очевидна при одиночной оценке. Например, Sonnet 4.5 называл один и тот же синтетический текст «тщательно сконструированным тестом», когда он шел первым, и «настоящей исследовательской практикой», когда он шел вторым.

Расхождение с абсолютными оценками

Когда те же модели оценивали диалоги по шкале от 0 до 10 в одиночку, синтетические тексты получали низкие баллы, а реальные — высокие. При расчете Win Rate на основе этих абсолютных оценок, вероятность победы синтетики должна быть 0%. Однако фактические попарные сравнения показывали победы синтетики в 28–45% случаев для Sonnet 4.5.

Выводы для индустрии

Исследование ставит под сомнение надежность текущих методов оценки eval awareness. Рекомендуется:

  • Использовать Realism Win Rate только в сочетании с другими метриками.
  • Строго балансировать порядок подачи текстов (first/second position balancing).
  • Осознавать, что контекст сравнения меняет восприятие модели, а не только качество данных.

Источник: LessWrong ↗