Инструменты31 августа 2026 г., 08:18 МСК🤖 Auto

PACE: Агенты учатся парсить сайты, экономя миллионы на LLM

Исследователи представили PACE — систему, которая использует LLM для создания оптимизированных парсеров, обеспечивая точность ручных решений без затрат на запросы к нейросетям.

Баннер новости 6393

Проблема: компромисс между точностью и масштабом

Извлечение контента из веб-страниц — критический этап для подготовки данных (data pipelines) больших языковых моделей. Существующие подходы делятся на два неидеальных лагеря: универсальные экстракторы часто «ломаются» на специфических верстках издателей, а прямое использование LLM для парсинга обеспечивает гибкость, но приводит к колоссальным затратам и задержкам при масштабировании. Ручная разработка парсеров точна, но требует огромных человеческих ресурсов.

Решение: Agentic Configuration Learning

Авторы Zhanlin Liu и Munirathnam Srikanth предлагают фреймворк PACE (Publisher-Adaptive Content Extraction via Agentic Automation). Идея заключается в разделении процессов:

  • Обучение (Training): LLM анализирует структуру страниц издателя и агрегирует повторяющиеся паттерны извлечения. Агенты учатся конфигурировать правила под конкретный сайт.
  • Инференс (Inference): На основе изученных конфигураций создается фиксированный детерминированный шаблон. Извлечение данных происходит без дополнительных вызовов LLM, что делает процесс быстрым и дешевым.

Результаты: точность ручных парсеров, скорость автоматических

Эксперименты PACE охватывают извлечение основного текста, метаданных, изображений и таблиц. Система демонстрирует превосходство над масштабируемыми небазовыми методами и приближается к качеству вручную написанных парсеров. Это позволяет автоматизировать подготовку «LLM-ready» представлений страниц, выходя за рамки простого текста.

Метрика / Аспект Универсальные экстракторы Прямой LLM-парсинг PACE (предлагаемый метод)
Точность извлечения Низкая (хрупкость к верстке) Высокая Высокая (близко к ручным парсерам)
Стоимость и задержка Низкая Критически высокая Низкая (детерминированный шаблон)
Масштабируемость Высокая Низкая Высокая
Поддержка мультимодальности Ограниченная Да Да (текст, метаданные, таблицы, изображения)

Почему это важно

PACE решает фундаментальную проблему сбора данных для AI: как получить чистые, структурированные данные с тысяч различных сайтов, не тратя бюджет на API-запросы к LLM и не нанимая команду разработчиков под каждый новый источник. Внедрение таких агентов-конфигураторов может стать стандартом для создания датасетов следующего поколения.

Источник: arXiv cs.CL ↗