Исследования11 июля 2026 г., 09:16 МСК🤖 Auto

SQuaD-SQL: Как малые модели догнали LLM в Text-to-SQL

Исследователи представили метод SQuaD-SQL, позволяющий компактным языковым моделям достигать точности 86.9% в генерации SQL-запросов, используя дистилляцию знаний от больших моделей.

Баннер новости 3365

Проблема ресурсоемкости LLM

Генерация SQL-запросов по естественному языку (Text-to-SQL) остается фундаментальной задачей NLP. Несмотря на выдающиеся результаты больших языковых моделей (LLM), их развертывание часто невозможно в условиях ограниченных вычислительных ресурсов. Высокие требования к памяти и задержки при инференсе делают LLM непрактичными для многих корпоративных сценариев, где требуется быстрый доступ к структурированным базам данных.

Решение: SQuaD-SQL

Команда авторов во главе с Ваньюем У (Wangyu Wu) предложила архитектуру SQuaD-SQL (Small-Qualified and Distilled for SQL). Метод позволяет малым языковым моделям (SLM) приблизиться к производительности LLM за счет трех ключевых компонентов:

  • Генерация синтетических данных: Использование LLM для извлечения структурированных знаний через продуманные промпты.
  • Параметрически эффективное дообучение: Полное обучение модели возможно на одной потребительской видеокарте.
  • Адаптация к домену: Использование специфичных синтетических данных для повышения точности в целевых областях.

Результаты на WikiSQL

Эксперименты проводились на датасете WikiSQL. Ключевым показателем стала точность выполнения запросов (Execution Accuracy). SQuaD-SQL продемонстрировал результат 86.9% на тестовой выборке, что сопоставимо с показателями более тяжелых LLM, но при этом обеспечивает значительно более быстрое время отклика и меньшее потребление памяти.

Метрика Результат SQuaD-SQL Значение
Точность выполнения (Exec. Acc.) 86.9% Уровень, близкий к LLM
Требования к железу Одна GPU Доступно для потребителей
Скорость инференса Высокая Быстрее LLM

Значение для индустрии

Работа, принятая к публикации в IEEE SMC 2026, доказывает, что при правильной стратегии обучения малые модели могут служить эффективной альтернативой гигантам в задачах работы с базами данных. Это открывает путь к внедрению AI-интерфейсов к данным в среды с жесткими ограничениями по инфраструктуре.

Источник: arXiv cs.CL ↗