Проблема эвристик в Text-to-SQL
При генерации SQL-запросов из естественного языка (Text-to-SQL) ключевая проблема — надежность LLM на этапе инференса. Стандартные подходы, такие как Best-of-N sampling (выбор лучшего из N вариантов) и Majority Voting (голосование большинства), опираются на простые эвристики: успешность выполнения запроса или частоту появления в выводах. Эти методы плохо различают семантически правильные, но синтаксически разные запросы, что ограничивает точность конечного результата.
Решение: GradeSQL и Outcome Reward Models
Авторы (Mattia Tritto, Giuseppe Farano и соавторы из Университета Фоджа и других институтов) предлагают использовать Outcome Reward Models (ORM) как обученные функции семантической оценки. Главная инновация — фреймворк GradeSQL, который позволяет обучать такие модели без ручной аннотации данных. Обучение происходит через автоматическую генерацию кандидатов и их выполнение (execution-based labeling), что делает процесс масштабируемым.
Результаты на бенчмарках
Интеграция ORM в пайплайн Best-of-N показала стабильное превосходство над эвристическими методами. Исследование проводилось на открытых моделях семейства LLM в двух ключевых бенчмарках: BIRD (сложные запросы с внешними знаниями) и Spider (кросс-доменная точность). Прирост точности (execution accuracy) оказался значимым, особенно для сложных запросов:
| Бенчмарк | Метрика | Прирост точности (ORM vs Эвристики) | Примечание |
|---|---|---|---|
| BIRD | Execution Accuracy | +4.33% | Максимальный прирост на сложных запросах |
| Spider | Execution Accuracy | +2.10% | Стабильное улучшение по всем доменам |
Масштабируемость и значимость
Эксперименты показали, что ORM-верификация эффективно масштабируется: чем больше кандидатов генерируется (N), тем сильнее преимущество семантической оценки перед простым голосованием. Работа принята к публикации на воркшопе SURGeLLM Workshop at ACL 2026 (Сан-Диего, США). Код, датасеты и модели опубликованы в открытом доступе, что позволяет разработчикам внедрять более надежную верификацию SQL-запросов в свои продукты без дорогостоящей разметки данных.
Источник: arXiv cs.CL ↗
