Проблема ненадежности LLM-парсеров
Генерация веб-скраперов на основе естественного языка часто терпит неудачу из-за ошибок зависимостей, сломанных селекторов и несоответствия схем. Авторы предлагают сместить фокус с генерации свободного кода на создание типизированных JSON-конфигураций коллекторов, что обеспечивает верифицируемость и безопасность при сбое.
Архитектура решения
Фреймворк использует шесть типов коллекторов, шаблоны и функции утилит для ограничения пространства поиска. Ключевые компоненты:
- Статическое выполнение DAG в Airflow;
- Правила проверки качества на основе правил;
- Структурированная обратная связь для коррекции ошибок.
Результаты экспериментов
Тестирование проводилось на 138 задачах. На 80 из них, верифицированных независимо, система продемонстрировала нулевое потребление токенов LLM на этапе выполнения, что критично для снижения затрат при регулярном сборе данных.
| Метрика | Значение / Описание |
|---|---|
| Количество задач | 138 (всего), 80 (верифицированных) |
| Потребление токенов (execution) | 0 (ноль токенов LLM на этапе запуска) |
| Время выполнения | Самое низкое среднее время (wall-clock time) |
| Тип данных | Typed JSON collector configurations |
Значение для индустрии
Подход предлагает компромисс: умеренное качество генерации «на лету» заменяется на переиспользуемый, детерминированный и верифицируемый путь выполнения. Это делает фреймворк идеальным для задач повторного сбора данных с открытого веба, где важна стабильность и низкая стоимость операций.
Источник: arXiv cs.AI ↗
