Проблема закрытых систем Auto-DSM
Автоматизированная генерация матриц структуры проектирования (Auto-DSM) критически важна для системной инженерии (MBSE), однако большинство коммерческих пайплайнов остаются закрытыми. Исследователи Niels Potters и Theo Hofman (поданы 7 июля 2026 года) предложили прозрачную фреймворк-методологию для оценки LLM в этой задаче. Цель — сравнить сгенерированные матрицы (GEN-DSM) с вручную валидированными эталонами (GT-DSM), выявляя системные ошибки ИИ.
Метрики и подход «черного ящика»
Фреймворк оценивает модели не только по точности, но и по стабильности. Используется комплексный показатель качества (Composite Quality Score, Q), который агрегирует три группы метрик:
- Структурные: Полнота (Completeness), Правильность (Correctness), Плотность связей (Coupling Density).
- Классификационные: Селективная точность (Selective Accuracy), Покрытие отказов от ответа (Abstention Coverage).
- Стабильность: Энтропия и коэффициент Кappa Флейсса (Fleiss' κ) для оценки воспроизводимости результатов.
Эксперимент: от абстракции до холодильника
Тестирование проводилось на двух наборах данных: вымышленной абстрактной системе и реальной декомпозиции холодильника. Исследователи варьировали формулировки промптов, сложность системы и соответствие параметров данным. Результаты показали, что LLM способны генерировать структурно правдоподобные DSM, но их надежность резко падает при наличии неоднозначности в документации или непоследовательных определениях зависимостей.
Ключевые выводы и ограничения
Исследование выявило конкретные источники сбоев LLM в инженерных задачах. Ниже приведена сводка эффективности моделей в зависимости от качества входных данных:
| Условие входа | Результат (GEN-DSM vs GT-DSM) | Основная проблема |
|---|---|---|
| Хорошо структурированные данные | Высокая воспроизводимость, низкая энтропия | Минимальные галлюцинации |
| Неоднозначные формулировки | Низкая Selective Accuracy | Галлюцинации связей |
| Нестабильные определения зависимостей | Низкий Fleiss' κ | Низкая стабильность между запусками |
Авторы заключают, что интеграция LLM в MBSE-пайплайны возможна, но требует строгого аудита через предложенный фреймворк для контроля «отказов от ответа» и галлюцинаций.
Источник: arXiv cs.AI ↗
