Исследования2 сентября 2026 г., 08:18 МСК🤖 Auto

SCAFFOLD: первый датасет для обучения VLM анализировать схемы в статьях

Исследователи представили SCAFFOLD — крупнейший структурированный датасет из 157 тысяч пар «изображение-вопрос» с цепочками рассуждений (CoT) для обучения мультимодальных моделей пониманию архитектурных схем.

Баннер новости 6561

Проблема: VLM не понимают научные диаграммы

Текст научных статей по информатике часто сопровождается сложными диаграммами: схемами архитектуры, блок-схемами потоков данных и пайплайнами. Эти визуальные элементы несут больше информации, чем сопроводительный текст. Однако существующие датасеты для обучения Vision-Language Models (VLM) не содержат специфических пар «изображение-контекст-вопрос-ответ» для таких диаграмм, что делает невозможным эффективное обучение моделей их интерпретации.

Решение: Структурированный датасет SCAFFOLD

Команда авторов (Ranjit Raut, Aarav Subedi, Sagun Rai, Sudan Jha) представила SCAFFOLD — набор данных, собранный из статей arXiv. Процесс создания включал:

  • Layout Detection & PDF Parsing: Автоматическое извлечение изображений и их контекста из PDF-файлов.
  • AI-Assisted Question Generation: Генерация вопросов и ответов с использованием ИИ.
  • Chain-of-Thought (CoT): Добавление пошаговых траектов рассуждений для каждого ответа, что критически важно для обучения моделей логическому выводу.

Масштаб и структура данных

Датасет выпущен в трех вариантах размера для разных задач fine-tuning и исследований:

Версия датасета Количество пар (Image-QA) Количество статей Количество фигур
SCAFFOLD-157K 157 387 3 058 29 887
SCAFFOLD-37K 36 797
SCAFFOLD-12K 12 000

Базовые эксперименты и результаты

Для валидации подхода авторы использовали набор SCAFFOLD-12K для базового тестирования модели Qwen2.5-VL-3B-Instruct. Это демонстрирует применимость датасета для дообучения существующих открытых VLM на специфической задаче понимания компьютерных наук.

Почему это важно

SCAFFOLD закрывает критический пробел в данных для мультимодальных AI. Без таких датасетов модели остаются «слепыми» к ключевой визуальной информации в технической литературе. Публикация датасета позволяет сообществу обучать модели, способные не просто «видеть» схемы, но и объяснять их логику через цепочки рассуждений.

Источник: arXiv cs.AI ↗