Проблема статических тестов
Оценка современных больших языковых моделей (LLM) столкнулась с тупиком: статические бенчмарки (MMLU, GSM8K) перенасыщены, а данные для обучения часто содержат ответы из тестов. Это делает невозможным различение топ-моделей. Желание разработчиков — найти метрику, устойчивую к contamination (загрязнению данных) и субъективности человеческой оценки.
Механика Peer-Probing
Команда авторов (Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo) предложила фреймворк LivingArena. Суть проста: модели играют в ролевую игру «вопрос-ответ».
- Вопрошающий (Questioner): Генерирует вопрос, цель которого — заставить оппонента ошибиться. Получает награду, если ответ неверен.
- Отвечающий (Answerer): Должен дать правильный ответ. Получает награду за точность.
- Судейская панель: Группа сильных моделей проверяет, чтобы вопросы имели объективно верный ответ, и штрафует тех, кто задает некорректные или двусмысленные вопросы.
Результаты и метрики
В исследовании протестированы 10 передовых LLM. LivingArena сгенерировал стабильный рейтинг Elo, который коррелирует с реальными способностями моделей, но слабо связан с предпочтениями людей (human preference). Это означает, что модель может нравиться людям, но проигрывать в логической строгости.
| Критерий | Статические бенчмарки | LivingArena (Peer-Probing) |
|---|---|---|
| Устойчивость к contamination | Низкая (данные утекают в датасеты) | Высокая (вопросы генерируются динамически) |
| Что измеряет | Запоминание фактов | Глубина знаний и способность атаковать |
| Стоимость оценки | Высокая (масштабирование сложно) | Низкая (автоматизировано и масштабируемо) |
| Корреляция с Human Preference | Высокая | Слабая (измеряет фактологическую строгость) |
Почему это важно
Анализ логов показал, что модели не просто отвечают, а локализуют слабые стороны оппонентов. Они «выслеживают» пробелы в знаниях других моделей и концентрируют усилия там. LivingArena предлагает новый взгляд на оценку: не «кто больше знает», а «кто лучше понимает границы чужого незнания».
Источник: arXiv cs.AI ↗
