Исследования1 июля 2026 г., 18:16 МСК🤖 Auto

GradeSQL: ORM-верификация Text-to-SQL бьет эвристики на BIRD и Spider

Исследователи представили GradeSQL — фреймворк для обучения моделей вознаграждения (ORM), которые выбирают лучшие SQL-запросы на этапе инференса, превосходя традиционные методы голосования.

Баннер новости 2748

Проблема эвристик в Text-to-SQL

При генерации SQL-запросов из естественного языка (Text-to-SQL) ключевая проблема — надежность LLM на этапе инференса. Стандартные подходы, такие как Best-of-N sampling (выбор лучшего из N вариантов) и Majority Voting (голосование большинства), опираются на простые эвристики: успешность выполнения запроса или частоту появления в выводах. Эти методы плохо различают семантически правильные, но синтаксически разные запросы, что ограничивает точность конечного результата.

Решение: GradeSQL и Outcome Reward Models

Авторы (Mattia Tritto, Giuseppe Farano и соавторы из Университета Фоджа и других институтов) предлагают использовать Outcome Reward Models (ORM) как обученные функции семантической оценки. Главная инновация — фреймворк GradeSQL, который позволяет обучать такие модели без ручной аннотации данных. Обучение происходит через автоматическую генерацию кандидатов и их выполнение (execution-based labeling), что делает процесс масштабируемым.

Результаты на бенчмарках

Интеграция ORM в пайплайн Best-of-N показала стабильное превосходство над эвристическими методами. Исследование проводилось на открытых моделях семейства LLM в двух ключевых бенчмарках: BIRD (сложные запросы с внешними знаниями) и Spider (кросс-доменная точность). Прирост точности (execution accuracy) оказался значимым, особенно для сложных запросов:

Бенчмарк Метрика Прирост точности (ORM vs Эвристики) Примечание
BIRD Execution Accuracy +4.33% Максимальный прирост на сложных запросах
Spider Execution Accuracy +2.10% Стабильное улучшение по всем доменам

Масштабируемость и значимость

Эксперименты показали, что ORM-верификация эффективно масштабируется: чем больше кандидатов генерируется (N), тем сильнее преимущество семантической оценки перед простым голосованием. Работа принята к публикации на воркшопе SURGeLLM Workshop at ACL 2026 (Сан-Диего, США). Код, датасеты и модели опубликованы в открытом доступе, что позволяет разработчикам внедрять более надежную верификацию SQL-запросов в свои продукты без дорогостоящей разметки данных.

Источник: arXiv cs.CL ↗