Провал надежд на универсальное решение
Новый бенчмарк SemPlan, опубликованный в arXiv (автор Bruno Santos Teixeira), ставит жирную точку в спорах о том, можно ли просто «улучшить промпт» или добавить «агента», чтобы LLM начала идеально работать с корпоративными данными. Авторы создали детерминированный двуязычный датасет (английский и бразильский португальский) из 1 800 кейсов, из которых 1 200 являются «замороженной» научной выборкой для объективного сравнения.
Главный вывод исследования пессимистичен для энтузиастов Text-to-SQL: абсолютная точность ответов (answer correctness) во всех tested архитектурах крайне низка. Ни одна из моделей не преодолела барьер в 26%.
Сравнение архитектур: A1 против A4
Исследователи протестировали четыре подхода (архитектуры) на 4 800 первичных записях. Вот как они распределились по точности генерации корректных ответов:
| Архитектура | Описание метода | Точность ответа (%) | Ключевая особенность |
|---|---|---|---|
| A1 | Прямая генерация SQL | 22.25% | Высочайшая политика безопасности, минимум некорректных запросов |
| A2 | Базовый инструмент-агент (bounded tool-agent) | 22.58% | Базовый уровень контроля |
| A3 | Структурированный семантический запрос + детерминированное планирование | 25.67% | Лидер по точности, статистически значимое превосходство над A1/A2/A4 |
| A4 | Уточнение + семантический план с состоянием (stateful) | 24.25% | Самая низкая стоимость API, минимум ложных отказов |
Компромисс: Точность vs Стоимость vs Безопасность
Исследование подчеркивает, что не существует «универсального ранжирования». Усложнение архитектуры меняет характер ошибок, но не решает проблему неоднозначности и согласованности состояния в многошаговых диалогах.
- A3 (Планирование) выигрывает в точности, но требует больше вычислительных ресурсов.
- A1 (Прямой SQL) остается самым безопасным: у него самый низкий процент небезопасных или невалидных запросов, что критично для enterprise-среды.
- A4 (Stateful) оптимален по экономике: наименьшая средняя стоимость API-вызовов и наименьший процент ложных отказов (false-refusal rate).
Стабильность результатов
На подмножестве из 150 случаев для проверки стабильности (repeatability) разброс между моделями составил от 92.00% до 98.67%. Это означает, что если модель выдала правильный ответ, она с высокой вероятностью выдаст его снова, но проблема в том, что она ошибается в 75% случаев изначально.
Вывод SemPlan: структурные ограничения меняют режимы сбоев и эффективность, но не монотонно улучшают точность. Инженерам придется выбирать между безопасностью (A1), точностью (A3) и стоимостью (A4), а не ждать, пока одна архитектура победит во всех категориях.
Источник: arXiv cs.AI ↗
