Проблема: LLM не справляются с многомерными данными
Генерация понятных отчетов для политиков и общественности из сложных эпидемиологических проекций — сложная задача. Традиционные большие языковые модели (LLM) при попытке суммировать большие ансамблевые наборы данных часто допускают несоответствия, упускают важные детали и демонстрируют нестабильное поведение. Данные часто включают различные вмешательства, географические и демографические страты, временные горизонты и квантили неопределенности, что требует строгой количественной привязки.
Решение: EpiNarrate и разделение логики
Команда авторов (Rituparna Datta, Srini Venkatramanan, Bryan L. Lewis и др.) представила EpiNarrate — агентный фреймворк, который разделяет структурированное численное рассуждение и генерацию естественного языка. Архитектура работает в два этапа:
- Извлечение и организация: Система извлекает оси сценариев и организует их в схему частичного порядка, позволяя систематически обходить многомерное пространство данных.
- Генерация утверждений: Создается дополненный набор данных, из которого выводятся корректные количественные утверждения с помощью «грамматики сравнения», обеспечивающей семантическую и арифметическую согласованность.
Механизм отбора: Максимальная энтропия
Для баланса между полнотой охвата и отсутствием избыточности в EpiNarrate внедрен механизм отбора, основанный на принципах максимальной энтропии. Это позволяет системе выбирать наиболее «интересные» и информативные паттерны, избегая дублирования информации в итоговом отчете.
Результаты на данных COVID-19
Эксперименты проводились на базе COVID-19 Scenario Modeling Hub. Результаты показали, что модель EpiNarrate генерирует нарративы с улучшенной фактологической точностью и более широким охватом значимых эпидемиологических паттернов по сравнению с прямым использованием LLM, сохраняя при этом стиль, характерный для отчетов, написанных экспертами.
| Аспект | Традиционные LLM | EpiNarrate (Agentic Framework) |
|---|---|---|
| Обработка данных | Прямая генерация текста | Разделение на численное рассуждение и текст |
| Точность фактов | Частые галлюцинации и ошибки | Гарантия арифметической согласованности |
| Структура | Неорганизованный поток | Схема частичного порядка осей сценариев |
| Отбор информации | Случайный или поверхностный | Механизм максимальной энтропии |
Значимость
Работа, опубликованная 17 июля 2026 года, демонстрирует путь к созданию надежных инструментов для общественного здравоохранения. EpiNarrate показывает, что агентный подход с жесткой привязкой к данным может преодолеть ограничения «черного ящика» в критически важных областях, где точность цифр так же важна, как и ясность изложения.
Источник: arXiv cs.CL ↗
