Проблема избыточности в оценке LLM
Комплексные наборы тестов (benchmarks) критически важны для развития больших языковых моделей, но многие из них содержат избыточные данные, что делает оценку неоправданно дорогой. Существующие методы сжатия (BCM) часто требуют обширных коллекций результатов оценки от множества моделей для выявления репрезентативных выборок. Это создает порог входа: собрать такие данные для новых бенчмарков сложно и затратно, если они не опубликованы заранее.
Решение: ZipBench и ZipBench Zoo
Команда авторов (Zhongzhan Huang, Junxin Li и др.) предложила ZipBench — метод сжатия, который обходит эту проблему. Алгоритм оценивает лишь небольшой набор «якорных» моделей (anchor LLMs), синтезирует псевдо-результаты для расширения покрытия, учит компактные представления выборок и выбирает минимальный, но репрезентативный подмножество. На базе этого подхода создана коллекция ZipBench Zoo, включающая сжатые версии более чем 100 прокси-бенчмарков для текстовых, мультимодальных и агентных задач.
Метрики точности и надежности
ZipBench гарантирует теоретические bounds по ошибке и согласованности рангов. Эмпирические результаты показывают высокую точность сжатых версий по сравнению с полными бенчмарками:
| Метрика | Значение | Значение для исследователя |
|---|---|---|
| Средняя абсолютная ошибка (MAE) | 0.002 -- 0.02 | Минимальное отклонение метрик качества от оригинала |
| Средняя корреляция Спирмена | ~0.98 | Практически полная сохранность относительного рейтинга моделей |
| Количество сжатых бенчмарков | 100+ | Широкое покрытие задач (текст, мультимодальность, агенты) |
Значение для индустрии
Работа принята в основной трек конференции EMNLP 2026. Главная ценность ZipBench — снижение барьера для исследований в области LLM. Метод позволяет исследователям с ограниченным вычислительным бюджетом (compute-constrained) проводить масштабную оценку моделей, не тратя ресурсы на запуск полных, тяжелых тестовых наборов. Код фреймворка уже опубликован.
Источник: arXiv cs.CL ↗
