Исследования9 июля 2026 г., 06:16 МСК🤖 Auto

Auto-DSM: Как LLM генерируют матрицы связей и где они сходят с ума

Исследователи представили первую черную-ящик методологию оценки LLM для генерации Design Structure Matrices (DSM). Тесты показали, что модели надежны на четких данных, но склонны к галлюцинациям при неоднозначности.

Баннер новости 3172

Проблема закрытых систем Auto-DSM

Автоматизированная генерация матриц структуры проектирования (Auto-DSM) критически важна для системной инженерии (MBSE), однако большинство коммерческих пайплайнов остаются закрытыми. Исследователи Niels Potters и Theo Hofman (поданы 7 июля 2026 года) предложили прозрачную фреймворк-методологию для оценки LLM в этой задаче. Цель — сравнить сгенерированные матрицы (GEN-DSM) с вручную валидированными эталонами (GT-DSM), выявляя системные ошибки ИИ.

Метрики и подход «черного ящика»

Фреймворк оценивает модели не только по точности, но и по стабильности. Используется комплексный показатель качества (Composite Quality Score, Q), который агрегирует три группы метрик:

  • Структурные: Полнота (Completeness), Правильность (Correctness), Плотность связей (Coupling Density).
  • Классификационные: Селективная точность (Selective Accuracy), Покрытие отказов от ответа (Abstention Coverage).
  • Стабильность: Энтропия и коэффициент Кappa Флейсса (Fleiss' κ) для оценки воспроизводимости результатов.

Эксперимент: от абстракции до холодильника

Тестирование проводилось на двух наборах данных: вымышленной абстрактной системе и реальной декомпозиции холодильника. Исследователи варьировали формулировки промптов, сложность системы и соответствие параметров данным. Результаты показали, что LLM способны генерировать структурно правдоподобные DSM, но их надежность резко падает при наличии неоднозначности в документации или непоследовательных определениях зависимостей.

Ключевые выводы и ограничения

Исследование выявило конкретные источники сбоев LLM в инженерных задачах. Ниже приведена сводка эффективности моделей в зависимости от качества входных данных:

Условие входа Результат (GEN-DSM vs GT-DSM) Основная проблема
Хорошо структурированные данные Высокая воспроизводимость, низкая энтропия Минимальные галлюцинации
Неоднозначные формулировки Низкая Selective Accuracy Галлюцинации связей
Нестабильные определения зависимостей Низкий Fleiss' κ Низкая стабильность между запусками

Авторы заключают, что интеграция LLM в MBSE-пайплайны возможна, но требует строгого аудита через предложенный фреймворк для контроля «отказов от ответа» и галлюцинаций.

Источник: arXiv cs.AI ↗