Исследования20 июля 2026 г., 08:18 МСК🤖 Auto

DrawingVQA: AI провалил тест на чертежах, требуя экспертных знаний

Новый бенчмарк DrawingVQA, принятый в CVPR 2026, показал, что современные мультимодальные модели (MLLM) не готовы к работе с реальными строительными чертежами из-за разрыва в навыках многоуровневого рассуждения.

Баннер новости 3925

Проблема: Чертежи сложнее, чем картинки

Исследователи из Университета Южной Калифорнии (Южнокалифорнийский университет) представили DrawingVQA — первый в своем роде набор данных для оценки мультимодальных больших языковых моделей (MLLM) на реальных инженерных документах. В отличие от схематичных планов или фотографий, «Issued for Construction» (IFC) чертежи содержат сложный микс абстрактной геометрии, символьных обозначений, табличных данных и специфической терминологии. Именно этот контекст становится камнем преткновения для ИИ.

Методология: Три глубины рассуждения

Для оценки способностей моделей авторы разработали фреймворк, разделяющий задачи на три уровня сложности. Датасет включает 33 реальных чертежа и 92 экспертно составленных вопроса (Q&A). Ключевая инновация — двойная категоризация: анализ идет как по инженерным, так и по ИИ-компетенциям.

Уровень рассуждения Описание задачи Пример вопроса
1. Перцептивное понимание Распознавание базовых элементов: линий, стрелок, текстовых меток. «Какой диаметр у этой трубы?»
2. Контекстуальная интерпретация Связь визуальных элементов с их функциональным назначением в системе. «Какое оборудование подключено к этому узлу?»
3. Экспертное рассуждение Применение инженерных знаний для вывода, неочевидного из визуала. «Соответствует ли эта деталь нормам безопасности?»

Результаты: Разрыв с экспертами

Тестирование state-of-the-art MLLM выявило существенный разрыв между производительностью моделей и уровнем человеческих экспертов. Особенно критичным оказался третий уровень — domain-expert reasoning. Модели часто справляются с простым распознаванием символов, но терпят неудачу при необходимости «понять» логику чертежа, опираясь на скрытые инженерные связи.

Значение для отрасли

Работа, принятая в CVPR 2026 Findings, закладывает фундамент для создания специализированных ИИ-инструментов в архитектуре и гражданском строительстве. Текущие универсальные модели не могут заменить инженера в рабочих процессах, так как не обладают достаточным уровнем доменной экспертизы. DrawingVQA служит точкой отсчета для развития ИИ, способного интегрироваться в реальные инженерные воркфлоу, а не просто генерировать описания к картинкам.

Источник: arXiv cs.AI ↗