Суть проблемы: хрупкость метрики
Исследователи Achu Menon и Santiago Aranguri (программа SPAR) проанализировали метрику Realism Win Rate, используемую для оценки того, насколько синтетические диалоги (генерируемые для тестов) похожи на реальные разговоры. Метрика предполагает, что если LLM-судья чаще выбирает тестовый диалог как «более реалистичный» по сравнению с реальным, то тесты слишком реалистичны и модель может «запомнить» их.
Оказалось, что эта метрика критически зависит от порядка подачи данных. Судьи систематически отдают предпочтение тексту, стоящему вторым в паре сравнения, что делает результаты измерений искаженными.
Ключевые цифры и предвзятость позиций
В эксперименте использовались модели Claude Sonnet 4.5 и Opus 4.5 в роли судей (с 2000 токенами на размышления). Синтетические диалоги генерировались моделью Petri. Результаты показали сильную позицию-зависимость:
| Модель-судья | Эффект позиции (разница в %) | Инфляция Realism Win Rate (по сравнению с абсолютными оценками) |
|---|---|---|
| Claude Sonnet 4.5 | 30–43 п.п. (преимущество второго места) | 28–45 п.п. (вместо ожидаемых 0%) |
| Claude Opus 4.5 | 7–9 п.п. (преимущество второго места) | 4–7 п.п. (вместо ожидаемых 0%) |
Цифры показывают, что при попарном сравнении судьи «видят» нереалистичность там, где она очевидна при одиночной оценке. Например, Sonnet 4.5 называл один и тот же синтетический текст «тщательно сконструированным тестом», когда он шел первым, и «настоящей исследовательской практикой», когда он шел вторым.
Расхождение с абсолютными оценками
Когда те же модели оценивали диалоги по шкале от 0 до 10 в одиночку, синтетические тексты получали низкие баллы, а реальные — высокие. При расчете Win Rate на основе этих абсолютных оценок, вероятность победы синтетики должна быть 0%. Однако фактические попарные сравнения показывали победы синтетики в 28–45% случаев для Sonnet 4.5.
Выводы для индустрии
Исследование ставит под сомнение надежность текущих методов оценки eval awareness. Рекомендуется:
- Использовать Realism Win Rate только в сочетании с другими метриками.
- Строго балансировать порядок подачи текстов (first/second position balancing).
- Осознавать, что контекст сравнения меняет восприятие модели, а не только качество данных.
Источник: LessWrong ↗
