Исследования2 июля 2026 г., 07:17 МСК🤖 Auto

Bo Chen: Конstrained Agent Framework для сбора данных с веба

Исследователь Bo Chen представил фреймворк, превращающий генерацию парсеров LLM в детерминированный процесс с нулевым потреблением токенов на этапе выполнения.

Баннер новости 2776

Проблема ненадежности LLM-парсеров

Генерация веб-скраперов на основе естественного языка часто терпит неудачу из-за ошибок зависимостей, сломанных селекторов и несоответствия схем. Авторы предлагают сместить фокус с генерации свободного кода на создание типизированных JSON-конфигураций коллекторов, что обеспечивает верифицируемость и безопасность при сбое.

Архитектура решения

Фреймворк использует шесть типов коллекторов, шаблоны и функции утилит для ограничения пространства поиска. Ключевые компоненты:

  • Статическое выполнение DAG в Airflow;
  • Правила проверки качества на основе правил;
  • Структурированная обратная связь для коррекции ошибок.

Результаты экспериментов

Тестирование проводилось на 138 задачах. На 80 из них, верифицированных независимо, система продемонстрировала нулевое потребление токенов LLM на этапе выполнения, что критично для снижения затрат при регулярном сборе данных.

Метрика Значение / Описание
Количество задач 138 (всего), 80 (верифицированных)
Потребление токенов (execution) 0 (ноль токенов LLM на этапе запуска)
Время выполнения Самое низкое среднее время (wall-clock time)
Тип данных Typed JSON collector configurations

Значение для индустрии

Подход предлагает компромисс: умеренное качество генерации «на лету» заменяется на переиспользуемый, детерминированный и верифицируемый путь выполнения. Это делает фреймворк идеальным для задач повторного сбора данных с открытого веба, где важна стабильность и низкая стоимость операций.

Источник: arXiv cs.AI ↗