Исследования14 июля 2026 г., 10:17 МСК🤖 Auto

Сжатие LLM-бенчмарков: как семантические эмбеддинги экономят вычисления

Исследователи представили метод отбора репрезентативных подмножеств промптов (coresets) для оценки LLM, который превосходит традиционные подходы, используя только семантические векторы без запуска моделей.

Баннер новости 3522

Проблема масштабирования оценки LLM

Оценка больших языковых моделей (LLM) требует огромных вычислительных ресурсов. Стандартные бенчмарки, такие как MMLU или MTEB, содержат десятки тысяч запросов, проверка которых на современных моделях (например, GPT-4, Claude 3.5) обходится в миллионы долларов. Авторы исследования предлагают новый подход — Evaluation-Unsupervised Prompt Subset Selection (отбор подмножества промптов без использования результатов оценки), который позволяет сократить объем данных, сохраняя точность ранжирования моделей.

Масштаб эксперимента: 35 бенчмарков и 61K промптов

Для валидации метода команда использовала новый набор из 35 гетерогенных бенчмарков, охватывающих 5 категорий способностей (от математики до кодирования). В тестировании участвовали 18 передовых LLM и более 61 000 промптов. Ключевая идея заключается в использовании субмодулярных функций для выбора минимального набора промптов, который максимально точно репрезентирует весь датасет.

Победитель: Facility Location (FL) на семантических эмбеддингах

Исследователи протестировали различные субмодулярные функции, включая процессы детерминантных точек (DPP) и функции взаимной информации. Лучший результат показала функция Facility Location (FL), работающая исключительно с дешевыми семантическими эмбеддингами промптов. Она не требует запуска самих LLM на этапе отбора данных, что делает процесс подготовки к тестированию практически бесплатным по сравнению с полным прогон.

d>
Метод отбора Тип данных Результат (сохранение ранга LLM) Вычислительная стоимость
Facility Location (FL) (предложенный) Семантические эмбеддинги Лучший (превосходит 12 базовых методов) Минимальная (только NLP-векторизация)
DPP (Determinantal Point Processes) Семантические эмбеддинги Хороший, но уступает FL Средняя
Score-based Baselines Результаты оценки моделей Ниже, чем у FL в режиме unsupervised Очень высокая (требует прогона LLM)
Diversity-based Baselines Разнообразие данных Не стабильно сохраняет ранги Низкая

Почему это важно для индустрии

Результаты показывают, что субмодулярная оптимизация — это надежный инструмент для сжатия бенчмарков. Метод работает не только в режиме «без оценки» (unsupervised), но и в гибридном сценарии, когда нужно выбрать несколько целых бенчмарков из доступных. В таких условиях FL-функция на MMLU и MTEB лидербордах либо совпадает с state-of-the-art, либо превосходит их, экономя значительные ресурсы на вычисления. Это открывает путь к созданию более быстрых и дешевых стандартов оценки для LLM.

Источник: arXiv cs.AI ↗