Проблема: Чертежи сложнее, чем картинки
Исследователи из Университета Южной Калифорнии (Южнокалифорнийский университет) представили DrawingVQA — первый в своем роде набор данных для оценки мультимодальных больших языковых моделей (MLLM) на реальных инженерных документах. В отличие от схематичных планов или фотографий, «Issued for Construction» (IFC) чертежи содержат сложный микс абстрактной геометрии, символьных обозначений, табличных данных и специфической терминологии. Именно этот контекст становится камнем преткновения для ИИ.
Методология: Три глубины рассуждения
Для оценки способностей моделей авторы разработали фреймворк, разделяющий задачи на три уровня сложности. Датасет включает 33 реальных чертежа и 92 экспертно составленных вопроса (Q&A). Ключевая инновация — двойная категоризация: анализ идет как по инженерным, так и по ИИ-компетенциям.
| Уровень рассуждения | Описание задачи | Пример вопроса |
|---|---|---|
| 1. Перцептивное понимание | Распознавание базовых элементов: линий, стрелок, текстовых меток. | «Какой диаметр у этой трубы?» |
| 2. Контекстуальная интерпретация | Связь визуальных элементов с их функциональным назначением в системе. | «Какое оборудование подключено к этому узлу?» |
| 3. Экспертное рассуждение | Применение инженерных знаний для вывода, неочевидного из визуала. | «Соответствует ли эта деталь нормам безопасности?» |
Результаты: Разрыв с экспертами
Тестирование state-of-the-art MLLM выявило существенный разрыв между производительностью моделей и уровнем человеческих экспертов. Особенно критичным оказался третий уровень — domain-expert reasoning. Модели часто справляются с простым распознаванием символов, но терпят неудачу при необходимости «понять» логику чертежа, опираясь на скрытые инженерные связи.
Значение для отрасли
Работа, принятая в CVPR 2026 Findings, закладывает фундамент для создания специализированных ИИ-инструментов в архитектуре и гражданском строительстве. Текущие универсальные модели не могут заменить инженера в рабочих процессах, так как не обладают достаточным уровнем доменной экспертизы. DrawingVQA служит точкой отсчета для развития ИИ, способного интегрироваться в реальные инженерные воркфлоу, а не просто генерировать описания к картинкам.
Источник: arXiv cs.AI ↗
