Проблема фрагментации в LLM-оценке
Парадигма LLM-as-a-judge стала доминирующей для ранжирования языковых моделей, однако экосистема оценки остается фрагментированной. Большинство существующих бенчмарков поставляются с собственными кодовыми базами, жестко зашивают специфические закрытые модели в качестве судей и поддерживают только один протокол оценки. Это усложняет изучение того, как выбор бенчмарка, модели-судьи, промпта или бэкенда инференса влияет на выводы о качестве модели.
Решение: JudgeArena
Команда авторов во главе с Эрлисом Луштаку представила JudgeArena — фреймворк с открытым исходным кодом, который объединяет крупные LLM-судейские бенчмарки под единым интерфейсом. В систему интегрированы:
- AlpacaEval
- Arena-Hard
- MT-Bench
- m-Arena-Hard
Ключевая особенность — возможность замены модели-судьи и логирование метаданных для обеспечения прозрачности и воспроизводимости результатов. Любая модель, доступная через vLLM, TGI или OpenRouter, может выступать как кандидат, так и судья.
Открытые модели против закрытых
Исследователи разработали настроенные конфигурации для открытых моделей, которые по качеству сопоставимы или превосходят закрытых судей. Валидация проводилась на наборах данных человеческих предпочдений как на английском, так и на мультиязычных языках. Это снижает зависимость от непрозрачных закрытых моделей.
Симуляция Elo-рейтинга
JudgeArena позволяет симулировать рейтинги Elo с высокой точностью, комбинируя существующие аннотации людей с оценками LLM-судей. Это предлагает практичную, открытую и низкозатратную альтернативу масштабным кампаниям по аннотированию данных людьми.
| Компонент | Описание |
|---|---|
| Интегрированные бенчмарки | AlpacaEval, Arena-Hard, MT-Bench, m-Arena-Hard |
| Поддерживаемые бэкенды | vLLM, TGI, OpenRouter |
| Языковая поддержка | Английский и мультиязычные наборы данных |
| Ключевая метрика | Точная симуляция LMArena Elo |
Значение для индустрии
Введение JudgeArena позволяет исследователям и разработчикам систематически изучать влияние выбора судьи на результаты оценки. Это способствует переходу к более прозрачной и воспроизводимой практике в оценке больших языковых моделей, снижая барьеры для использования открытых альтернатив закрыным решениям.
Источник: arXiv cs.CL ↗
