Проблема: VLM не понимают научные диаграммы
Текст научных статей по информатике часто сопровождается сложными диаграммами: схемами архитектуры, блок-схемами потоков данных и пайплайнами. Эти визуальные элементы несут больше информации, чем сопроводительный текст. Однако существующие датасеты для обучения Vision-Language Models (VLM) не содержат специфических пар «изображение-контекст-вопрос-ответ» для таких диаграмм, что делает невозможным эффективное обучение моделей их интерпретации.
Решение: Структурированный датасет SCAFFOLD
Команда авторов (Ranjit Raut, Aarav Subedi, Sagun Rai, Sudan Jha) представила SCAFFOLD — набор данных, собранный из статей arXiv. Процесс создания включал:
- Layout Detection & PDF Parsing: Автоматическое извлечение изображений и их контекста из PDF-файлов.
- AI-Assisted Question Generation: Генерация вопросов и ответов с использованием ИИ.
- Chain-of-Thought (CoT): Добавление пошаговых траектов рассуждений для каждого ответа, что критически важно для обучения моделей логическому выводу.
Масштаб и структура данных
Датасет выпущен в трех вариантах размера для разных задач fine-tuning и исследований:
| Версия датасета | Количество пар (Image-QA) | Количество статей | Количество фигур |
|---|---|---|---|
| SCAFFOLD-157K | 157 387 | 3 058 | 29 887 |
| SCAFFOLD-37K | 36 797 | — | — |
| SCAFFOLD-12K | 12 000 | — | — |
Базовые эксперименты и результаты
Для валидации подхода авторы использовали набор SCAFFOLD-12K для базового тестирования модели Qwen2.5-VL-3B-Instruct. Это демонстрирует применимость датасета для дообучения существующих открытых VLM на специфической задаче понимания компьютерных наук.
Почему это важно
SCAFFOLD закрывает критический пробел в данных для мультимодальных AI. Без таких датасетов модели остаются «слепыми» к ключевой визуальной информации в технической литературе. Публикация датасета позволяет сообществу обучать модели, способные не просто «видеть» схемы, но и объяснять их логику через цепочки рассуждений.
Источник: arXiv cs.AI ↗
