Исследования24 июля 2026 г., 11:18 МСК🤖 Auto

LLM-катастрофа: ИИ игнорирует скрытые угрозы при анализе данных с датчиков

Новое исследование arXiv (2026) показало, что топовые LLM (ChatGPT-4o, Gemini 2.5, Llama 3.1) провалили тест на оценку физических опасностей: они не генерируют предупреждения, когда несколько датчиков показывают аномалии, но не превышают индивидуальн

Баннер новости 4282

Суть проблемы: «Слепота» к кумулятивному риску

Исследователь Фаизан Икбал провел эмпирический бенчмарк, оценивший способность пяти крупных языковых моделей интерпретировать мультисенсорные данные. В тесте использовалось 60 сценариев и 1 800 API-вызовов (temperature 0.0). Главная находка: модели демонстрируют близкую к нулю точность в сценариях, где несколько датчиков одновременно фиксируют повышенные значения, но остаются в пределах индивидуальных норм безопасности. При этом они идеально справляются с простыми нарушениями одного датчика.

Ключевые метрики и сравнение моделей

Разрыв в производительности между обработкой одиночных и множественных сигналов критичен для промышленной безопасности. Ниже приведены результаты по категориям сценариев:

Категория сценария Описание Точность (Score) Примечание
Категория A (Мультисенсор) Несколько датчиков повышены, но ниже лимитов 0.000 – 0.208 (Q2)
0.000 – 0.592 (Q3)
Модели не выдают предупреждений
Категория B (Одиночный датчик) Прямое превышение порога одним датчиком 0.975 – 1.000 Практически идеальная работа

В тесте участвовали: ChatGPT-4o, Gemini 2.5 Flash, DeepSeek, Kimi и Llama 3.1 8B. Ни одна из моделей не смогла корректно оценить кумулятивный эффект от совокупности «некритичных» аномалий.

Формат данных влияет на результат

Исследование также выявило зависимость от формата ввода. Использование структурированных табличных данных не дало преимущества перед обычным текстом. Более того, ChatGPT-4o показал статистически значимое улучшение при работе с текстовым описанием (prose) по сравнению с таблицами (p = 0.001). Это опровергает распространенное мнение о том, что LLM всегда лучше работают с табличными данными.

Почему это важно для индустрии

Результаты имеют прямые последствия для внедрения ИИ в системы мониторинга физической безопасности. Если промышленные системы полагаются на LLM для анализа данных с датчиков (температуры, давления, газа), существует высокий риск пропуска реальных угроз, которые проявляются как совокупность мелких отклонений. Разработчикам следует пересмотреть подходы к валидации ИИ-решений в критических инфраструктурах, добавляя тесты на выявление скрытых корреляций.

Источник: arXiv cs.AI ↗