Инструменты6 августа 2026 г., 06:16 МСК🤖 Auto

JudgeArena: Единая платформа для оценки LLM-судей

Исследователи представили JudgeArena — open-source фреймворк, унифицирующий оценку языковых моделей через LLM-as-a-judge, устраняющий фрагментацию бенчмарков и снижающий зависимость от закрытых моделей.

Баннер новости 5181

Проблема фрагментации в LLM-оценке

Парадигма LLM-as-a-judge стала доминирующей для ранжирования языковых моделей, однако экосистема оценки остается фрагментированной. Большинство существующих бенчмарков поставляются с собственными кодовыми базами, жестко зашивают специфические закрытые модели в качестве судей и поддерживают только один протокол оценки. Это усложняет изучение того, как выбор бенчмарка, модели-судьи, промпта или бэкенда инференса влияет на выводы о качестве модели.

Решение: JudgeArena

Команда авторов во главе с Эрлисом Луштаку представила JudgeArena — фреймворк с открытым исходным кодом, который объединяет крупные LLM-судейские бенчмарки под единым интерфейсом. В систему интегрированы:

  • AlpacaEval
  • Arena-Hard
  • MT-Bench
  • m-Arena-Hard

Ключевая особенность — возможность замены модели-судьи и логирование метаданных для обеспечения прозрачности и воспроизводимости результатов. Любая модель, доступная через vLLM, TGI или OpenRouter, может выступать как кандидат, так и судья.

Открытые модели против закрытых

Исследователи разработали настроенные конфигурации для открытых моделей, которые по качеству сопоставимы или превосходят закрытых судей. Валидация проводилась на наборах данных человеческих предпочдений как на английском, так и на мультиязычных языках. Это снижает зависимость от непрозрачных закрытых моделей.

Симуляция Elo-рейтинга

JudgeArena позволяет симулировать рейтинги Elo с высокой точностью, комбинируя существующие аннотации людей с оценками LLM-судей. Это предлагает практичную, открытую и низкозатратную альтернативу масштабным кампаниям по аннотированию данных людьми.

Компонент Описание
Интегрированные бенчмарки AlpacaEval, Arena-Hard, MT-Bench, m-Arena-Hard
Поддерживаемые бэкенды vLLM, TGI, OpenRouter
Языковая поддержка Английский и мультиязычные наборы данных
Ключевая метрика Точная симуляция LMArena Elo

Значение для индустрии

Введение JudgeArena позволяет исследователям и разработчикам систематически изучать влияние выбора судьи на результаты оценки. Это способствует переходу к более прозрачной и воспроизводимой практике в оценке больших языковых моделей, снижая барьеры для использования открытых альтернатив закрыным решениям.

Источник: arXiv cs.CL ↗