Проблема: нехватка данных для Semantic Web в строительстве
Автоматизация зданий всё чаще использует семантические графы знаний (KG) на базе онтологий Brick и ASHRAE 223P. Это позволяет ИИ-агентам управлять системами через естественный язык. Однако развитие направления Text-to-SPARQL тормозит отсутствие масштабных бенчмарков. Большинство существующих наборов данных малы или содержат ошибки в самих запросах, так как генерируются нейросетями.
Решение: Build2SPARQL и конвейер генерации
В работе представлен датасет Build2SPARQL, созданный с помощью KG-grounded pipeline. Ключевая особенность метода: SPARQL-запросы генерируются и валидируются строго программным кодом (graph-traversal), а большие языковые модели (LLM) используются только для создания естественных вопросов. Это гарантирует 100% корректность синтаксиса запросов, исключая влияние «галлюцинаций» модели на структуру данных.
Пайплайн охватывает шесть семейств паттернов запросов: линейные цепочки, ветвление, UNION, агрегация, OPTIONAL и фильтрация атрибутов. Каждый запрос фразирован в пяти регистрах лексики для разнообразия.
Масштаб и качество данных
Датасет применен к 201 графу знаний зданий (180 на базе Brick, 21 на базе ASHRAE 223P). Итоговая выборка включает 6 136 исполняемых SPARQL-запросов и 30 680 естественных вопросов. Качество данных подтверждено ручной валидацией выборки из 300 вопросов двумя экспертами:
| Метрика | Значение | Комментарий |
|---|---|---|
| Семантическая точность | 98.8% | Вопрос точно отражает смысл запроса |
| Естественность | 98.8% | Формулировки понятны человеку |
| Операционная правдоподобность | 84.0% | Запросы релевантны реальным задачам эксплуатации |
Результаты тестирования LLM
Авторы провели оценку retrieval-augmented generation (RAG) на трех открытых моделях. Использование датасета для контекста позволило значительно повысить точность генерации кода:
| Режим | Точность (Exact Match) | Примечание |
|---|---|---|
| Zero-shot | 0.2% – 20% | Без примеров в контексте |
| Three-shot RAG | 56% – 65% | С извлечением релевантных примеров |
Датасет открыто доступен для сообщества. Работа находится на рецензировании в журнале ASCE Journal of Computing in Civil Engineering.
Источник: arXiv cs.AI ↗
