Исследования11 августа 2026 г., 08:18 МСК🤖 Auto

NL2SHACL-Bench: LLM не справляются со сложной логикой в RDF

Исследователи представили первый бенчмарк NL2SHACL-Bench для оценки способности LLM переводить естественный язык в валидационные правила SHACL. Модели генерируют синтаксически верный код, но проваливают сложные семантические задачи.

Баннер новости 5500

Проблема валидации знаний

SHACL (Shapes Constraint Language) — это стандарт W3C для проверки соответствия RDF-графов знаний заданным правилам. Однако создание этих правил требует глубоких технических знаний, недоступных большинству предметных экспертов. Идея автоматического перевода требований на естественном языке (NL) в код SHACL (NL2SHACL) звучит привлекательно, но до сих пор отсутствовал специализированный инструмент для оценки таких систем.

Что такое NL2SHACL-Bench

Команда исследователей во главе с Юченем Чжоу (Yuchen Zhou) представила NL2SHACL-Bench — первый специализированный набор данных для этой задачи. Главная сложность оценки заключается в том, что два SHACL-файла могут быть семантически идентичными, но иметь разную структуру и сериализацию. Обычное сравнение строк здесь не работает, поэтому бенчмарк использует продвинутые методы проверки эквивалентности.

Результаты тестирования SOTA-моделей

Авторы протестировали четыре передовые большие языковые модели (LLM). Результаты показали четкое разделение: модели отлично справляются с синтаксисом, но теряются в логике. Они генерируют валидный код, который проходит проверку на синтаксические ошибки, но не всегда корректно реализуют сложные логические и структурные паттерны, заложенные в запросе.

Аспект оценки Результат LLM Комментарий
Синтаксическая валидность Высокая Модели успешно генерируют код, который парсится и валидируется движками SHACL.
Семантическая точность Низкая/Средняя При сложных логических связях и структурных паттернах возникают ошибки в интерпретации требований.
Применимость бенчмарка Подтверждена NL2SHACL-Bench выявил реальные пробелы в текущих возможностях LLM, недоступные при простом сравнении строк.

Почему это важно

Отсутствие надежного бенчмарка тормозило развитие инструментов для автоматизации онтологий. NL2SHACL-Bench предоставляет объективную метрику для измерения прогресса в области NL2SHACL. Для разработчиков Semantic Web это сигнал: пока полагаться на LLM для критически важных правил валидации данных нельзя, особенно в сценариях со сложной бизнес-логикой.

Источник: arXiv cs.AI ↗