Проблема: компромисс между точностью и масштабом
Извлечение контента из веб-страниц — критический этап для подготовки данных (data pipelines) больших языковых моделей. Существующие подходы делятся на два неидеальных лагеря: универсальные экстракторы часто «ломаются» на специфических верстках издателей, а прямое использование LLM для парсинга обеспечивает гибкость, но приводит к колоссальным затратам и задержкам при масштабировании. Ручная разработка парсеров точна, но требует огромных человеческих ресурсов.
Решение: Agentic Configuration Learning
Авторы Zhanlin Liu и Munirathnam Srikanth предлагают фреймворк PACE (Publisher-Adaptive Content Extraction via Agentic Automation). Идея заключается в разделении процессов:
- Обучение (Training): LLM анализирует структуру страниц издателя и агрегирует повторяющиеся паттерны извлечения. Агенты учатся конфигурировать правила под конкретный сайт.
- Инференс (Inference): На основе изученных конфигураций создается фиксированный детерминированный шаблон. Извлечение данных происходит без дополнительных вызовов LLM, что делает процесс быстрым и дешевым.
Результаты: точность ручных парсеров, скорость автоматических
Эксперименты PACE охватывают извлечение основного текста, метаданных, изображений и таблиц. Система демонстрирует превосходство над масштабируемыми небазовыми методами и приближается к качеству вручную написанных парсеров. Это позволяет автоматизировать подготовку «LLM-ready» представлений страниц, выходя за рамки простого текста.
| Метрика / Аспект | Универсальные экстракторы | Прямой LLM-парсинг | PACE (предлагаемый метод) |
|---|---|---|---|
| Точность извлечения | Низкая (хрупкость к верстке) | Высокая | Высокая (близко к ручным парсерам) |
| Стоимость и задержка | Низкая | Критически высокая | Низкая (детерминированный шаблон) |
| Масштабируемость | Высокая | Низкая | Высокая |
| Поддержка мультимодальности | Ограниченная | Да | Да (текст, метаданные, таблицы, изображения) |
Почему это важно
PACE решает фундаментальную проблему сбора данных для AI: как получить чистые, структурированные данные с тысяч различных сайтов, не тратя бюджет на API-запросы к LLM и не нанимая команду разработчиков под каждый новый источник. Внедрение таких агентов-конфигураторов может стать стандартом для создания датасетов следующего поколения.
Источник: arXiv cs.CL ↗
