Проблема: библиотечные данные слишком специфичны
Библиотеки и архивы сталкиваются с дилеммой: у них ограниченные бюджеты на вычисления и персонал, но есть сложные задачи обработки каталогов. Существующие бенчмарки (например, LCSHBench) часто не учитывают специфику библиотечных метаданных или используют реальные данные, которые могут «засветиться» в обучающих выборках современных LLM. Это делает невозможным честное тестирование моделей на актуальных задачах.
Решение: SHELF как генератор синтетических данных
SHELF (Synthetic Harness for Evaluating LLM Fitness) — это Python-система, которая генерирует контролируемые данные для бенчмарков. Она использует таксономии Библиотеки Конгресса США (Library of Congress), спецификации написания и бюджет генерации для создания задач. Ключевое преимущество: система может создавать верифицируемо новые документы, которых не существовало на момент обучения модели, исключая риск contamination (загрязнения данных).
Масштаб и задачи
Первый релиз SHELF включает 62 899 документов, написанных моделями. Набор охватывает пять основных типов задач:
- Классификация предметов (Subject classification)
- Классификация жанров/форм (Genre-form classification)
- Кластеризация
- Классификация пар (Pair classification)
- Инструктивный поиск (Instruction retrieval)
Результаты: где LLM сильны, а где слабы
Авторы протестировали различные методы: от TF-IDF и BM25 до современных энкодеров и zero-shot декодеров. Результаты показали высокую поляризацию способностей моделей:
| Задача | Лучший результат (Accuracy) | Комментарий |
|---|---|---|
| Классификация предметов | 0.8887 | Высокая точность,_sparse методы (TF-IDF) остаются конкурентоспособными |
| Классификация жанров/форм | 0.2605 | Критически низкий результат, близкий к случайному угадыванию |
| Парная классификация | ~0.5 (уровень случайности) | Задачи остаются сложными для текущих архитектур |
| Кластеризация | ~0.5 (уровень случайности) | Метрики не показывают значимого улучшения |
В тестах на скорость TF-IDF показал себя как самый быстрый метод для классификации предметов, что важно для библиотек с ограниченными ресурсами.
Важность для индустрии
Сравнение с LCSHBench и Project Gutenberg показало, что рейтинги моделей (кто лучше кого) переносятся надежнее, чем абсолютные баллы. Однако авторы предупреждают: баллы SHELF не являются прямым предиктором точности на реальных производственных каталогах. Проект открыт на GitHub и Hugging Face под разрешительными лицензиями, что позволяет исследователям и библиотекам адаптировать harness под свои нужды.
Источник: arXiv cs.CL ↗
