Суть проблемы: «Слепота» к кумулятивному риску
Исследователь Фаизан Икбал провел эмпирический бенчмарк, оценивший способность пяти крупных языковых моделей интерпретировать мультисенсорные данные. В тесте использовалось 60 сценариев и 1 800 API-вызовов (temperature 0.0). Главная находка: модели демонстрируют близкую к нулю точность в сценариях, где несколько датчиков одновременно фиксируют повышенные значения, но остаются в пределах индивидуальных норм безопасности. При этом они идеально справляются с простыми нарушениями одного датчика.
Ключевые метрики и сравнение моделей
Разрыв в производительности между обработкой одиночных и множественных сигналов критичен для промышленной безопасности. Ниже приведены результаты по категориям сценариев:
| Категория сценария | Описание | Точность (Score) | Примечание |
|---|---|---|---|
| Категория A (Мультисенсор) | Несколько датчиков повышены, но ниже лимитов | 0.000 – 0.208 (Q2) 0.000 – 0.592 (Q3) |
Модели не выдают предупреждений |
| Категория B (Одиночный датчик) | Прямое превышение порога одним датчиком | 0.975 – 1.000 | Практически идеальная работа |
В тесте участвовали: ChatGPT-4o, Gemini 2.5 Flash, DeepSeek, Kimi и Llama 3.1 8B. Ни одна из моделей не смогла корректно оценить кумулятивный эффект от совокупности «некритичных» аномалий.
Формат данных влияет на результат
Исследование также выявило зависимость от формата ввода. Использование структурированных табличных данных не дало преимущества перед обычным текстом. Более того, ChatGPT-4o показал статистически значимое улучшение при работе с текстовым описанием (prose) по сравнению с таблицами (p = 0.001). Это опровергает распространенное мнение о том, что LLM всегда лучше работают с табличными данными.
Почему это важно для индустрии
Результаты имеют прямые последствия для внедрения ИИ в системы мониторинга физической безопасности. Если промышленные системы полагаются на LLM для анализа данных с датчиков (температуры, давления, газа), существует высокий риск пропуска реальных угроз, которые проявляются как совокупность мелких отклонений. Разработчикам следует пересмотреть подходы к валидации ИИ-решений в критических инфраструктурах, добавляя тесты на выявление скрытых корреляций.
Источник: arXiv cs.AI ↗
