Проблема линейных пайплайнов
Автоматическая генерация профессиональных отчетов, содержащих как текстовый анализ, так и визуализации, остается сложной задачей. Существующие методы опираются на фиксированные линейные конвейеры, где подзадачи (написание текста, создание графиков) решаются изолированно. Это приводит к потере фактической точности, несоответствию текста и графиков, а также к слабой связности повествования.
Решение: MCTS-Report
Команда авторов (Teng Lin, Zhiyang Zhang, Yuyu Luo, Nan Tang) предложила фреймворк MCTS-Report. В основе лежит подход, рассматривающий генерацию отчета как процесс пошагового построения в структурированном пространстве поиска. Отчет разбивается на атомарные действия, выполняемые LLM на основе текущего состояния документа:
- Планирование глав;
- Идентификация задач визуализации;
- Генерация графиков;
- Организация инсайтов;
- Уточнение нарратива.
Ключевая особенность — использование LLM для генерации пошагового рассуждения (reasoning) и сохранения траектории в узлах дерева поиска, что обеспечивает контекстную осведомленность.
Многомерная функция вознаграждения
Для навигации в дереве поиска разработана сложная функция вознаграждения, оценивающая несколько параметров одновременно:
- Числовая точность: проверяется через SQL-запросы к исходным данным;
- Качество графиков;
- Согласованность текста и визуализации;
- Структурная полнота;
- Штраф за разнообразие: подавляет повторение одних и тех же графиков;
- Проверка предусловий: отсекает невалидные действия.
Бенчмарк MMRBench и результаты
Для оценки метода создан датасет MMRBench, включающий реальные таблицы из шести различных предметных областей с экспертно отфильтрованными эталонными структурами отчетов. Эксперименты показали значительное превосходство MCTS-Report над сильными базовыми моделями.
| Метрика | Результат MCTS-Report | Значение |
|---|---|---|
| Общий балл (Overall Score) | 77.9 | Высокая的综合 эффективность |
| Структурная полнота | Значительно выше базовых | Логичная архитектура отчета |
| Числовая точность | Значительно выше базовых | Верификация через SQL |
| Согласованность текст/график | Значительно выше базовых | Отсутствие противоречий |
| Новизна инсайтов | Значительно выше базовых | Глубина анализа |
Работа опубликована 4 августа 2026 года в arXiv (cs.AI). Метод демонстрирует переход от простой генерации текста к сложному планированию мультимодального контента.
Источник: arXiv cs.AI ↗
