Что такое MecEng и зачем он нужен
Команда исследователей во главе с Йоханнесом Герстмайром (Johannes Gerstmayr) представила MecEng — полностью автоматизированный бенчмарк, оценивающий «инженерную осведомленность» больших языковых моделей. В отличие от стандартных тестов на код или математику, MecEng требует от LLM генерации готовых к симуляции моделей многокомпонентных систем (multibody simulation) на основе текстовых описаний.
Проверка происходит в два этапа: сначала LLM генерирует геометрию с помощью Netgen, затем строит модели для симулятора Exudyn. Итоговая верификация включает изоморфизм графов системы, численные решения и физические параметры (масса, геометрия, собственные частоты).
Масштаб и сложность задач
Бенчмарк состоит из 84 задач, разделенных на три уровня сложности. Ключевое отличие от простых тестов — необходимость работы с гибкими многокомпонентными системами, что требует:
- Точной генерации 3D-геометрии;
- Построения тетраэдральной сетки конечных элементов (FEM);
- Применения метода редукции порядка модели Хёрти-Крейга-Бэмптона (Hurty-Craig-Bampton).
Результаты: открытые vs проприетарные модели
В исследовании протестированы 32 открытые и 2 проприетарные LLM. На задачах с жесткими телами (rigid-body) результаты демонстрируют высокую эффективность современных моделей, однако гибкие системы остаются сложным вызовом.
| Тип задачи | Лучшая открытая модель | Лучшая проприетарная модель | Комментарий |
|---|---|---|---|
| Жесткие тела (Rigid-body) | 86.0% (успешность) | 91.4% (успешность) | Высокая точность, но разрыв в 5.4% сохраняется |
| Гибкие многокомпонентные системы | Значительно ниже | Значительно ниже | Задачи требуют FEM-мешинга и редукции моделей, остаются «узким местом» |
Факторы влияния
Дополнительные эксперименты показали, что на результат сильно влияют:
- Температура сэмплинга: более низкие значения повышают точность генерации кода.
- Размер модели и дата выпуска: наблюдается быстрое улучшение показателей у более новых и крупных моделей.
- Дизайн промптов: структура запроса критична для корректного построения графов связей.
Вывод
Результаты указывают на то, что LLM быстро развивают способность к инженерному моделированию, но пока остаются подверженными ошибкам, особенно в задачах, требующих сложной пространственной геометрии и физики деформируемых тел. MecEng открывает путь к систематической оценке и улучшению этих навыков у будущих версий моделей.
Источник: arXiv cs.AI ↗
