Исследования2 августа 2026 г., 04:16 МСК🤖 Auto

CrucibleBench: Как LLM-судьи искажают рейтинги моделей (падение Gemini на 6 мест)

Независимое исследование CrucibleBench показало, что использование LLM-классификаторов для оценки социальных навыков моделей критически искажает итоговые рейтинги. Модель Gemini 3.1 Pro потеряла 6 позиций из-за смещения судьи.

Баннер новости 4896

Суть эксперимента: MUD как полигон для AI

Группа независимых исследователей провела тестирование 13 моделей от 8 провайдеров в текстовом мире MUD (Multi-User Dungeon) под названием CrucibleBench. Это однопользовательская среда с 12 комнатами и 4 NPC, где модели должны выполнять социальные задачи: завоевывать доверие NPC и выявлять маскировку. Всего было выполнено 650 запусков (по 25 на задачу), что обошлось в $99.59. Оценка проводилась по четырем компонентам: преследование цели, социальная адаптация, привязка к миру и стратегическая сложность.

Проблема LLM-судей: скрытое искажение

Ключевая проблема выявлена в механизме оценки. Два из четырех компонентов оценки (и обновление состояния доверия NPC) опирались на классификатор Gemini Flash Lite. Это создало эффект «судьи, который является игроком»: метки классификатора напрямую влияли на динамику мира. При проверке надежности (reliability audit) согласованность между основным классификатором и независимым судьей оказалась низкой:

Метрика Результат Оценка
Intent Classification (κ) 0.11 Слабое согласие (18.9% точных совпадений)
Sentiment ICC 0.55 Умеренное согласие
Objective-probe detection (κ) 0.04 Плохое согласие (50.3% совпадений)

Результаты: как меняются рейтинги

Агрегированный коэффициент Каппа (κ) для обнаружения зондов составил всего 0.04, что маскирует серьезную нестабильность. Исследователи провели «абуляцию судьи» — удалили наиболее зависимые от классификатора компоненты оценки. В результате:

  • Общая корреляция рейтингов снизилась до Spearman ρ = 0.70.
  • Модель Gemini 3.1 Pro (из той же семьи, что и судья Gemini Flash Lite) рухнула с 3-го на 9-е место.

Это подтверждает гипотезу о bias по семейству моделей: LLM-судьи часто необоснованно завышают оценки моделям своих же разработчиков.

Выводы для индустрии

Исследование показывает, что стоимость инференса не коррелирует с поведенческой эффективностью (β = 0.007, p = 0.85). Более дорогие модели могут показывать результаты ниже медианы. Авторы призывают бенчмарки, использующие LLM-судей, обязательно публиковать аудит согласованности по подзадачам и тестировать стабильность рейтингов при исключении компонентов, зависимых от судьи.

Источник: LessWrong ↗