Исследования18 августа 2026 г., 09:18 МСК🤖 Auto

LLM в инженерии: MecEng тест показал 86% успеха у открытых моделей

Исследователи представили MecEng — первый автоматизированный бенчмарк для оценки способности LLM создавать модели многокомпонентной механики. Лучшие открытые модели достигли 86% точности на задачах жестких тел.

Баннер новости 5974

Что такое MecEng и зачем он нужен

Команда исследователей во главе с Йоханнесом Герстмайром (Johannes Gerstmayr) представила MecEng — полностью автоматизированный бенчмарк, оценивающий «инженерную осведомленность» больших языковых моделей. В отличие от стандартных тестов на код или математику, MecEng требует от LLM генерации готовых к симуляции моделей многокомпонентных систем (multibody simulation) на основе текстовых описаний.

Проверка происходит в два этапа: сначала LLM генерирует геометрию с помощью Netgen, затем строит модели для симулятора Exudyn. Итоговая верификация включает изоморфизм графов системы, численные решения и физические параметры (масса, геометрия, собственные частоты).

Масштаб и сложность задач

Бенчмарк состоит из 84 задач, разделенных на три уровня сложности. Ключевое отличие от простых тестов — необходимость работы с гибкими многокомпонентными системами, что требует:

  • Точной генерации 3D-геометрии;
  • Построения тетраэдральной сетки конечных элементов (FEM);
  • Применения метода редукции порядка модели Хёрти-Крейга-Бэмптона (Hurty-Craig-Bampton).

Результаты: открытые vs проприетарные модели

В исследовании протестированы 32 открытые и 2 проприетарные LLM. На задачах с жесткими телами (rigid-body) результаты демонстрируют высокую эффективность современных моделей, однако гибкие системы остаются сложным вызовом.

Тип задачи Лучшая открытая модель Лучшая проприетарная модель Комментарий
Жесткие тела (Rigid-body) 86.0% (успешность) 91.4% (успешность) Высокая точность, но разрыв в 5.4% сохраняется
Гибкие многокомпонентные системы Значительно ниже Значительно ниже Задачи требуют FEM-мешинга и редукции моделей, остаются «узким местом»

Факторы влияния

Дополнительные эксперименты показали, что на результат сильно влияют:

  • Температура сэмплинга: более низкие значения повышают точность генерации кода.
  • Размер модели и дата выпуска: наблюдается быстрое улучшение показателей у более новых и крупных моделей.
  • Дизайн промптов: структура запроса критична для корректного построения графов связей.

Вывод

Результаты указывают на то, что LLM быстро развивают способность к инженерному моделированию, но пока остаются подверженными ошибкам, особенно в задачах, требующих сложной пространственной геометрии и физики деформируемых тел. MecEng открывает путь к систематической оценке и улучшению этих навыков у будущих версий моделей.

Источник: arXiv cs.AI ↗