Инструменты5 сентября 2026 г., 06:17 МСК🤖 Auto

SHELF: Синтетический бенчмарк для библиотечных LLM с 62k документов

Исследователь Michael J. Bommarito II представил SHELF — систему для оценки LLM в библиотечных задачах. Набор данных из 62 899 документов позволяет тестировать классификацию, кластеризацию и поиск без риска утечки из обучающих выборок.

Баннер новости 6829

Проблема: библиотечные данные слишком специфичны

Библиотеки и архивы сталкиваются с дилеммой: у них ограниченные бюджеты на вычисления и персонал, но есть сложные задачи обработки каталогов. Существующие бенчмарки (например, LCSHBench) часто не учитывают специфику библиотечных метаданных или используют реальные данные, которые могут «засветиться» в обучающих выборках современных LLM. Это делает невозможным честное тестирование моделей на актуальных задачах.

Решение: SHELF как генератор синтетических данных

SHELF (Synthetic Harness for Evaluating LLM Fitness) — это Python-система, которая генерирует контролируемые данные для бенчмарков. Она использует таксономии Библиотеки Конгресса США (Library of Congress), спецификации написания и бюджет генерации для создания задач. Ключевое преимущество: система может создавать верифицируемо новые документы, которых не существовало на момент обучения модели, исключая риск contamination (загрязнения данных).

Масштаб и задачи

Первый релиз SHELF включает 62 899 документов, написанных моделями. Набор охватывает пять основных типов задач:

  • Классификация предметов (Subject classification)
  • Классификация жанров/форм (Genre-form classification)
  • Кластеризация
  • Классификация пар (Pair classification)
  • Инструктивный поиск (Instruction retrieval)

Результаты: где LLM сильны, а где слабы

Авторы протестировали различные методы: от TF-IDF и BM25 до современных энкодеров и zero-shot декодеров. Результаты показали высокую поляризацию способностей моделей:

Задача Лучший результат (Accuracy) Комментарий
Классификация предметов 0.8887 Высокая точность,_sparse методы (TF-IDF) остаются конкурентоспособными
Классификация жанров/форм 0.2605 Критически низкий результат, близкий к случайному угадыванию
Парная классификация ~0.5 (уровень случайности) Задачи остаются сложными для текущих архитектур
Кластеризация ~0.5 (уровень случайности) Метрики не показывают значимого улучшения

В тестах на скорость TF-IDF показал себя как самый быстрый метод для классификации предметов, что важно для библиотек с ограниченными ресурсами.

Важность для индустрии

Сравнение с LCSHBench и Project Gutenberg показало, что рейтинги моделей (кто лучше кого) переносятся надежнее, чем абсолютные баллы. Однако авторы предупреждают: баллы SHELF не являются прямым предиктором точности на реальных производственных каталогах. Проект открыт на GitHub и Hugging Face под разрешительными лицензиями, что позволяет исследователям и библиотекам адаптировать harness под свои нужды.

Источник: arXiv cs.CL ↗