Исследования20 июля 2026 г., 11:18 МСК🤖 Auto

LEED-сертификация с AI: почему мультимодальность мешает, а 4B-модель бьет 8B

Исследователи из UT Austin протестировали нейро-символический AI для проверки документов LEED v4.1. Выяснилось, что локальная модель на 4 млрд параметров работает точнее «тяжеловеса» в 8 млрд, а добавление изображений снижает точность.

Баннер новости 3935

Проблема: Ручной труд в документообороте

Получение сертификации LEED v4.1 BD+C — это процесс, требующий анализа сотен страниц проектной документации. Рецензенты вручную сопоставляют доказательства с критериями кредитов. Исследователи из Техасского университета в Остине (UT Austin) предложили автоматизировать этот процесс с помощью нейро-символического конвейера, который объединяет локальные LLM и детерминированные числовые проверки.

Методология и результаты: 4B против 8B

Команда протестировала систему на данных четырех университетских зданий, включающих 484 PDF-файла и 153 решения на уровне кредитов. Ключевой вывод: меньшая модель часто оказывается эффективнее в узких задачах.

Метрика / Модель Результат Примечание
gemma3:4b (текст) 67.3% точность Лучший текстовый верификатор
llama3.1:8b (текст) Ниже 67.3% Уступила более легкой модели
Полный нейро-символический пайплайн 61.6% точность Страдает от ошибок извлечения и консерватизма
Кредит EA-p2 (с числовым чекером) 100% точность Рост с 50% благодаря детерминированной проверке

Почему мультимодальность «вредит»?

Один из самых интригующих результатов — систематическое снижение точности при добавлении изображений. Включение чертежей низкого разрешения (150–300 dpi) в промпты негативно сказывалось на результатах. Это указывает на то, что для данной конкретной задачи анализа текстовых доказательств compliance, «шум» от визуальных данных перевешивает пользу, особенно если модель не обучалась на высококачественных архитектурных планах.

Стратегии промптинга зависят от проекта

Исследование показало, что универсального решения нет. Эффективность зависит от «богатства» документации проекта:

  • Chain-of-Thought (CoT): Лучше работает на проектах с дефицитом документации, помогая модели логически выводить ответы.
  • Rubric Prompts: Эффективнее на проектах с обильной документацией, где можно строго следовать рубрике.

Значение для индустрии

Работа демонстрирует, что для нишевых задач compliance (соответствия стандартам) не всегда нужны гигантские модели. Локальная部署 (deployment) модели на 4B параметров может обеспечить приемлемую точность, а интеграция символических компонентов (для проверки чисел) критически важна для устранения галлюцинаций в количественных показателях.

Источник: arXiv cs.AI ↗