Исследования4 августа 2026 г., 08:19 МСК🤖 Auto

Obshazard-bench: MLLM провалили тест на реальную разведку катастроф

Новый бенчмарк Obshazard-bench показал, что современные мультимодальные модели не готовы к работе с «сырыми» спутниковыми данными в реальном времени.

Баннер новости 5017

Проблема: разрыв между лабораторией и операционной средой

Исследователи из Китая (Fengxiang Wang и соавторы) представили Obshazard-bench — первый бенчмарк, оценивающий способность мультимодальных больших языковых моделей (MLLM) к анализу данных дистанционного зондирования Земли (ДЗЗ) в режиме реального времени. Главная проблема существующих подходов: они используют статические, обработанные экспертами данные (например, сеточные продукты реанализа), которые недоступны в момент возникновения ЧС. В реальной операции решения нужно принимать быстро, опираясь на «сырые» потоки данных.

Масштаб и структура данных

В отличие от традиционных подходов, Obshazard-bench исключает этапы физической инверсии и экспертной обработки. Модель получает на вход:

  • Высокочастотные потоки сырых спутниковых данных (различные сенсоры);
  • Данные наземных станций;
  • Исторические записи о катастрофах;
  • Социально-экономические индикаторы.

Бенчмарк охватывает 8 основных категорий и 28 подкатегорий бедствий в более чем 60 странах. В датасет включено более 120 исторических экстремальных событий и тысячи образцов вопросов и ответов (VQA), ориентированных на жизненный цикл катастрофы.

Три этапа оценки

Авторы разработали таксономию, соответствующую реальному рабочему процессу ликвидации ЧС:

Этап Задача модели Примеры метрик
Predictive Crisis Anticipation Предиктивное прогнозирование Раннее обнаружение рисков, прогнозирование до начала события
Active Evolution Reasoning Активное отслеживание Отслеживание развития катастрофы в реальном времени, предсказание завершения
Multi-faceted Impact Quantification Оценка последствий Определение масштаба, оценка гуманитарной нагрузки, социально-экономический ущерб

Результаты: модели не готовы

Эксперименты с репрезентативными общими и специализированными моделями (включая Earth-focused foundation models) выявили существенные ограничения. MLLM демонстрируют низкую способность трансформировать многоканальные физические наблюдения в обоснованные, привязанные ко времени выводы, необходимые для принятия решений. Модель часто не справляется с шумом «сырых» данных и необходимостью связывать пространственные наблюдения с временными рядами в условиях жесткого дефицита времени.

Почему это важно

Результаты исследования показывают, что текущие MLLM нельзя напрямую внедрять в системы раннего предупреждения. Для перехода от «чата с картинкой» к реальному инструменту спасения жизней необходимы модели, обученные на сырых физических потоках, а не на отфильтрованных экспертами продуктах.

Источник: arXiv cs.CL ↗