Исследования14 августа 2026 г., 11:18 МСК🤖 Auto

Reasoning Jury: Как консенсус моделей бьет топовые LLM в оценке рассуждений

Исследователи представили систему Reasoning Jury, которая использует коллективный разум открытых моделей для выявления ошибок в цепочках рассуждений, превосходя по точности проприетарные флагманы и экономя до 85% затрат.

Баннер новости 5783

Проблема одиночного судьи

Оценка качества длинных цепочек рассуждений (reasoning traces) критически важна для сбора данных, обучения с подкреплением (RL) и анализа поведения моделей. Однако одиночные LLM-судьи, даже самые передовые, часто не справляются с выявлением сложных логических дефектов. Кроме того, использование проприетарных моделей уровня frontier во время онлайн-обучения часто запрещено политиками безопасности.

Решение: Модерация и консенсус

Авторы предлагают систему Reasoning Jury, где роль одного судьи заменяется «присяжными» — группой LLM. Процесс включает:

  • Критику: присяжные обсуждают и оспаривают первоначальные вердикты друг друга.
  • Модерацию: модератор координирует дискуссию, помогая присяжным корректировать голоса.
  • Консолидацию: финальное решение принимается на основе достигнутых консенсусов или агрегации мнений.

Результаты: Открытые модели против флагманов

Эксперименты показали, что Reasoning Jury, использующая открытые модели (например, gpt-oss-120b), значительно превосходит по точности в выявлении логических ошибок такие модели, как opus-4.6, sonnet-4.6 и gemini-3.1-pro. Это доказывает, что архитектурный подход к оценке может быть эффективнее простого масштабирования параметров одного судьи.

Метрика / Аспект Reasoning Jury (Open Models) Frontier Models (Proprietary)
Точность выявления дефектов Значительно выше Ниже (проблемы с длинными цепочками)
Стоимость оценки 8–15% от стоимости frontier 100% (базовый уровень)
Примеры моделей gpt-oss-120b opus-4.6, sonnet-4.6, gemini-3.1-pro

Практическая польза

Помимо повышения точности, система позволяет глубже понимать режимы отказов (failure modes) reasoning-моделей на бенчмарках. Это дает разработчикам возможность не только оценивать, но и улучшать производительность моделей в реальном времени, предоставляя им обратную связь на основе выявленных логических ошибок.

Источник: arXiv cs.AI ↗