Проблема масштабирования LLM-анализа
Большие языковые модели (LLM) отлично справляются с анализом отдельных документов, но «ломаются» при попытке ответить на сложные аналитические вопросы по корпоративным массивам данных. Основные причины — переполнение контекстного окна, потеря атрибуции по сущностям и линейное увеличение задержки из-за последовательных вызовов инструментов. BatchDAG предлагает архитектурное решение: LLM генерирует типизированный направленный ациклический граф (DAG) операций, который детерминированный движок выполняет с помощью топологической параллельности.
Ключевая оптимизация: Entity-Aware Batching
Система использует стратегию «группировки по сущностям» перед параллельным выполнением (fan-out). Это позволяет объединять запросы к LLM, сокращая их количество до 47 раз. Вместо того чтобы обрабатывать каждую запись изолированно, BatchDAG формирует единый план выполнения, который движок исполняет через структурированный JSON-поток данных, исключая промежуточные текстовые сводки.
Результаты бенчмарков
В контролируемых экспериментах на 12 сложных запросах, требующих анализа транскриптов, BatchDAG показал результаты, сопоставимые с экспертно разработанными пайплайнами, и значительно превзошел агенты типа ReAct. Особое внимание уделено провенансу (происхождению данных): система обеспечивает 77% уровень подтверждения фактов из транскриптов против 46-60% у базовых моделей.
| Метрика | BatchDAG | Expert Pipeline | ReAct Agent |
|---|---|---|---|
| Качество ответа (оценка 1-5) | 3.74 | 3.25 | 3.09 |
| Уровень провенанса (Evidence Rate) | 77% | — | 46-60% |
| Снижение галлюцинаций (абляция) | -27% | — | — |
| Валидность сгенерированного DAG | 98.8% | — | — |
Производительность и экономика
В реальных условиях (production) система обрабатывает запросы по базе из 50 000+ встреч менее чем за 60 секунд. Экономическая эффективность достигается за счет оптимизации вызовов: стоимость одного запроса составляет от $0.02 до $0.24 при использовании тарифов GPT-5.1. Использование структурированных JSON-интермедиатов вместо текстовых сводок статистически значимо снижает уровень галлюцинаций (paired t-test, p=0.107, n=12).
Значение для индустрии
BatchDAG позиционируется не как инструмент для повышения точности отдельных моделей, а как универсальный оркестратор. Он заменяет множество ручных, «hand-engineered» рабочих процессов единой системой, способной генерировать оптимальную стратегию выполнения из естественного языка. Это открывает путь к масштабируемому ad-hoc анализу корпоративных данных без необходимости написания специализированного кода для каждого нового типа запроса.
Источник: arXiv cs.AI ↗
