Новый стандарт для критической инфраструктуры
Команда исследователей во главе с Ethan D. Frakes представила GeoOutageBench, специализированный бенчмарк, разработанный для оценки возможностей больших языковых моделей (LLM) в решении задач геопространственно-временного запроса к графам знаний (KGQA). В отличие от существующих наборов данных для веб-знаний, этот инструмент фокусируется на мультимодальных данных, критически важных для анализа устойчивости энергетической инфраструктуры.
Решение принято к публикации на конференции ACM SIGSPATIAL '26 (ноябрь 2026 года, Риверсайд, Калифорния). Исследование охватывает 13 страниц, 6 рисунков и 7 таблиц, предоставляя исчерпывающую методологию оценки.
Мультимодальная природа данных
Ключевое отличие GeoOutageBench заключается в интеграции разнородных источников данных в единый пространственно-временной граф знаний. Модель должна оперировать не только текстом, но и визуальной информацией, а также структурированными записями. Это позволяет модели анализировать реальные сценарии сбоев, учитывая контекст погоды, спутниковые снимки и географические сущности.
Таксономия запросов и уровни сложности
Бенчмарк предлагает таксономию компетенций (competency query taxonomy), разделенную на уровни сложности. Это позволяет тестировать LLM от базовых операций до сложных гипотетических сценариев. Основные классы запросов включают:
- Пространственно-временная содержательность и близость: Понимание того, где и когда произошло событие относительно других объектов.
- Анализ пространственно-временной совместимости: Выявление корреляций между событиями во времени и пространстве.
- Мультимодальные доказательства: Синтез информации из текста, изображений и структурированных данных.
- Гипотетическая оценка: Ответы на вопросы «что, если», требующие моделирования последствий.
Три ключевые метрики оценки
GeoOutageBench внедряет пользовательскую конфигурацию оценки по трем основным направлениям, которые ранее изучались недостаточно:
| Задача оценки | Суть проверки | Значимость |
|---|---|---|
| Интерпретация неоднозначности | Точность перевода естественного языка (NL) в язык запросов SPARQL при наличии неопределенности в формулировках. | Реальные запросы диспетчеров часто размыты; модель должна уметь уточнять контекст. |
| Полезность онтологии | Оценка того, насколько структура онтологии помогает в поиске ответов на специфические запросы. | Позволяет оптимизировать сами графы знаний для ИИ-систем. |
| Точность извлечения | Качество ответа LLM на основе мультимодального поиска по графу знаний. | Прямой индикатор готовности системы к работе с аварийными ситуациями. |
Открытые ресурсы
Авторы опубликовали исходный код, данные, результаты тестов и документацию, что делает GeoOutageBench доступным инструментом для сообщества. Это создает фундамент для разработки LLM-KG систем, способных поддерживать принятие решений в условиях реальных кризисов и аварий в энергосетях.
Источник: arXiv cs.AI ↗
