Суть эксперимента: MUD как полигон для AI
Группа независимых исследователей провела тестирование 13 моделей от 8 провайдеров в текстовом мире MUD (Multi-User Dungeon) под названием CrucibleBench. Это однопользовательская среда с 12 комнатами и 4 NPC, где модели должны выполнять социальные задачи: завоевывать доверие NPC и выявлять маскировку. Всего было выполнено 650 запусков (по 25 на задачу), что обошлось в $99.59. Оценка проводилась по четырем компонентам: преследование цели, социальная адаптация, привязка к миру и стратегическая сложность.
Проблема LLM-судей: скрытое искажение
Ключевая проблема выявлена в механизме оценки. Два из четырех компонентов оценки (и обновление состояния доверия NPC) опирались на классификатор Gemini Flash Lite. Это создало эффект «судьи, который является игроком»: метки классификатора напрямую влияли на динамику мира. При проверке надежности (reliability audit) согласованность между основным классификатором и независимым судьей оказалась низкой:
| Метрика | Результат | Оценка |
|---|---|---|
| Intent Classification (κ) | 0.11 | Слабое согласие (18.9% точных совпадений) |
| Sentiment ICC | 0.55 | Умеренное согласие |
| Objective-probe detection (κ) | 0.04 | Плохое согласие (50.3% совпадений) |
Результаты: как меняются рейтинги
Агрегированный коэффициент Каппа (κ) для обнаружения зондов составил всего 0.04, что маскирует серьезную нестабильность. Исследователи провели «абуляцию судьи» — удалили наиболее зависимые от классификатора компоненты оценки. В результате:
- Общая корреляция рейтингов снизилась до Spearman ρ = 0.70.
- Модель Gemini 3.1 Pro (из той же семьи, что и судья Gemini Flash Lite) рухнула с 3-го на 9-е место.
Это подтверждает гипотезу о bias по семейству моделей: LLM-судьи часто необоснованно завышают оценки моделям своих же разработчиков.
Выводы для индустрии
Исследование показывает, что стоимость инференса не коррелирует с поведенческой эффективностью (β = 0.007, p = 0.85). Более дорогие модели могут показывать результаты ниже медианы. Авторы призывают бенчмарки, использующие LLM-судей, обязательно публиковать аудит согласованности по подзадачам и тестировать стабильность рейтингов при исключении компонентов, зависимых от судьи.
Источник: LessWrong ↗
