Проблема «слепых» агентов в Text-to-SQL
В современных агентных системах для преобразования естественного языка в SQL (Text-to-SQL) основная проблема заключается в неэффективном использовании контекста. Широкие запросы часто приводят к тому, что модель тратит значительную часть контекстного окна и вычислительных ресурсов на базу данных, прежде чем появляются полезные данные. Постфактум сжать или отфильтровать уже отправленные запросы невозможно — потерянные строки и потраченные вычисления не восстановить.
Решение: BAP-SQL как контроллер бюджета
Авторы (Chong Peng, Pin Qian, Su Wang, Yihang Chen, Varun Sah) предлагают метод BAP-SQL (Budget-Aware Observation Planning). Суть подхода: формирование наблюдений рассматривается как этап контроля бюджета. Система оценивает «риск» запроса, переписывает SQL-запросы при наличии полезной информации и делегирует жесткие ограничения независимому runtime-щиту (shield). Это позволяет модели действовать более осознанно, экономя ресурсы до того, как они будут потрачены впустую.
Результаты бенчмарков
Методика протестирована на различных архитектурах: общих моделях на 4B параметров, специализированной модели FINER-SQL (4B) и моделях на 7B. Ключевые метрики показывают значительный прирост эффективности в условиях жестких ограничений контекста:
| Метрика / Модель | Результат BAP-SQL | Сравнение (SFT) |
|---|---|---|
| Прирост точности (BIRD-derived) | +3.4 / +3.6 п.п. | Превосходство над matched SFT |
| Экономия токенов | -4.5% / -5.0% | Меньше затрат на выполнение |
| Влияние на объем работы с БД | Не снижает | Оптимизация только контекста |
Важные нюансы и ограничения
Исследование выявило интересную зависимость: польза от BAP-SQL максимальна при жестких бюджетах. По мере увеличения мощности модели и доступного контекста эффект снижается. На самых «свободных» настройках (loosest setting) преимущество может даже инвертироваться. Важно отметить, что метод оптимизирует именно управление контекстом и планирование, но не уменьшает общий объем вычислительной работы с базой данных.
Почему это важно
Работа демонстрирует, что для агентов критически важно не просто генерировать код, а планировать процесс получения наблюдений. Успех связан с «видимым для политики» планированием и способностью системы спасать ситуацию при нехватке ресурсов. Это важный шаг к созданию более экономичных и надежных AI-ассистентов для работы с данными.
Источник: arXiv cs.AI ↗
