Исследования30 сентября 2026 г., 12:18 МСК🤖 Auto

GeoOutageBench: LLM-тест на устойчивость энергосетей с учетом неопределенности

Исследователи представили GeoOutageBench — первый бенчмарк для оценки LLM в задачах геопространственно-временного анализа аварий в энергосетях, интегрирующий визуальные, текстовые и структурированные данные.

Баннер новости 8590

Новый стандарт для критической инфраструктуры

Команда исследователей во главе с Ethan D. Frakes представила GeoOutageBench, специализированный бенчмарк, разработанный для оценки возможностей больших языковых моделей (LLM) в решении задач геопространственно-временного запроса к графам знаний (KGQA). В отличие от существующих наборов данных для веб-знаний, этот инструмент фокусируется на мультимодальных данных, критически важных для анализа устойчивости энергетической инфраструктуры.

Решение принято к публикации на конференции ACM SIGSPATIAL '26 (ноябрь 2026 года, Риверсайд, Калифорния). Исследование охватывает 13 страниц, 6 рисунков и 7 таблиц, предоставляя исчерпывающую методологию оценки.

Мультимодальная природа данных

Ключевое отличие GeoOutageBench заключается в интеграции разнородных источников данных в единый пространственно-временной граф знаний. Модель должна оперировать не только текстом, но и визуальной информацией, а также структурированными записями. Это позволяет модели анализировать реальные сценарии сбоев, учитывая контекст погоды, спутниковые снимки и географические сущности.

Таксономия запросов и уровни сложности

Бенчмарк предлагает таксономию компетенций (competency query taxonomy), разделенную на уровни сложности. Это позволяет тестировать LLM от базовых операций до сложных гипотетических сценариев. Основные классы запросов включают:

  • Пространственно-временная содержательность и близость: Понимание того, где и когда произошло событие относительно других объектов.
  • Анализ пространственно-временной совместимости: Выявление корреляций между событиями во времени и пространстве.
  • Мультимодальные доказательства: Синтез информации из текста, изображений и структурированных данных.
  • Гипотетическая оценка: Ответы на вопросы «что, если», требующие моделирования последствий.

Три ключевые метрики оценки

GeoOutageBench внедряет пользовательскую конфигурацию оценки по трем основным направлениям, которые ранее изучались недостаточно:

Задача оценки Суть проверки Значимость
Интерпретация неоднозначности Точность перевода естественного языка (NL) в язык запросов SPARQL при наличии неопределенности в формулировках. Реальные запросы диспетчеров часто размыты; модель должна уметь уточнять контекст.
Полезность онтологии Оценка того, насколько структура онтологии помогает в поиске ответов на специфические запросы. Позволяет оптимизировать сами графы знаний для ИИ-систем.
Точность извлечения Качество ответа LLM на основе мультимодального поиска по графу знаний. Прямой индикатор готовности системы к работе с аварийными ситуациями.

Открытые ресурсы

Авторы опубликовали исходный код, данные, результаты тестов и документацию, что делает GeoOutageBench доступным инструментом для сообщества. Это создает фундамент для разработки LLM-KG систем, способных поддерживать принятие решений в условиях реальных кризисов и аварий в энергосетях.

Источник: arXiv cs.AI ↗