Исследования29 июля 2026 г., 11:17 МСК🤖 Auto

LivingArena: LLM-турнир, где модели атакуют слабости друг друга

Исследователи представили LivingArena — систему оценки LLM, где модели соревнуются, задавая друг другу вопросы, которые оппонент не может решить. Это решает проблему загрязнения данных в бенчмарках.

Баннер новости 4616

Проблема статических тестов

Оценка современных больших языковых моделей (LLM) столкнулась с тупиком: статические бенчмарки (MMLU, GSM8K) перенасыщены, а данные для обучения часто содержат ответы из тестов. Это делает невозможным различение топ-моделей. Желание разработчиков — найти метрику, устойчивую к contamination (загрязнению данных) и субъективности человеческой оценки.

Механика Peer-Probing

Команда авторов (Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo) предложила фреймворк LivingArena. Суть проста: модели играют в ролевую игру «вопрос-ответ».

  • Вопрошающий (Questioner): Генерирует вопрос, цель которого — заставить оппонента ошибиться. Получает награду, если ответ неверен.
  • Отвечающий (Answerer): Должен дать правильный ответ. Получает награду за точность.
  • Судейская панель: Группа сильных моделей проверяет, чтобы вопросы имели объективно верный ответ, и штрафует тех, кто задает некорректные или двусмысленные вопросы.

Результаты и метрики

В исследовании протестированы 10 передовых LLM. LivingArena сгенерировал стабильный рейтинг Elo, который коррелирует с реальными способностями моделей, но слабо связан с предпочтениями людей (human preference). Это означает, что модель может нравиться людям, но проигрывать в логической строгости.

Критерий Статические бенчмарки LivingArena (Peer-Probing)
Устойчивость к contamination Низкая (данные утекают в датасеты) Высокая (вопросы генерируются динамически)
Что измеряет Запоминание фактов Глубина знаний и способность атаковать
Стоимость оценки Высокая (масштабирование сложно) Низкая (автоматизировано и масштабируемо)
Корреляция с Human Preference Высокая Слабая (измеряет фактологическую строгость)

Почему это важно

Анализ логов показал, что модели не просто отвечают, а локализуют слабые стороны оппонентов. Они «выслеживают» пробелы в знаниях других моделей и концентрируют усилия там. LivingArena предлагает новый взгляд на оценку: не «кто больше знает», а «кто лучше понимает границы чужого незнания».

Источник: arXiv cs.AI ↗