Проблема одиночного судьи
Оценка качества длинных цепочек рассуждений (reasoning traces) критически важна для сбора данных, обучения с подкреплением (RL) и анализа поведения моделей. Однако одиночные LLM-судьи, даже самые передовые, часто не справляются с выявлением сложных логических дефектов. Кроме того, использование проприетарных моделей уровня frontier во время онлайн-обучения часто запрещено политиками безопасности.
Решение: Модерация и консенсус
Авторы предлагают систему Reasoning Jury, где роль одного судьи заменяется «присяжными» — группой LLM. Процесс включает:
- Критику: присяжные обсуждают и оспаривают первоначальные вердикты друг друга.
- Модерацию: модератор координирует дискуссию, помогая присяжным корректировать голоса.
- Консолидацию: финальное решение принимается на основе достигнутых консенсусов или агрегации мнений.
Результаты: Открытые модели против флагманов
Эксперименты показали, что Reasoning Jury, использующая открытые модели (например, gpt-oss-120b), значительно превосходит по точности в выявлении логических ошибок такие модели, как opus-4.6, sonnet-4.6 и gemini-3.1-pro. Это доказывает, что архитектурный подход к оценке может быть эффективнее простого масштабирования параметров одного судьи.
| Метрика / Аспект | Reasoning Jury (Open Models) | Frontier Models (Proprietary) |
|---|---|---|
| Точность выявления дефектов | Значительно выше | Ниже (проблемы с длинными цепочками) |
| Стоимость оценки | 8–15% от стоимости frontier | 100% (базовый уровень) |
| Примеры моделей | gpt-oss-120b | opus-4.6, sonnet-4.6, gemini-3.1-pro |
Практическая польза
Помимо повышения точности, система позволяет глубже понимать режимы отказов (failure modes) reasoning-моделей на бенчмарках. Это дает разработчикам возможность не только оценивать, но и улучшать производительность моделей в реальном времени, предоставляя им обратную связь на основе выявленных логических ошибок.
Источник: arXiv cs.AI ↗
