Проблема согласованности в LLM-визуализации
Большие языковые модели (LLM) умеют генерировать отдельные диаграммы, но сталкиваются с крахом при создании Coordinated Multi-View Visualizations (CMV) — систем, где несколько графиков связаны общим потоком данных и взаимодействиями. Основная проблема заключается в «жесткой связности» (tight field-level coupling): ошибка в трансформации данных или визуальном кодировании автоматически делает невалидными все связанные компоненты. Традиционные end-to-end подходы зависят от случайных факторов, таких как доменные знания пользователя, и часто терпят неудачу.
Архитектура Crystalis: нуклеация и отжиг
Команда авторов (Dazhen Deng, Zhaoping He и др.) предложила фреймворк Crystalis, основанный на моделировании запросов (query-centric). Система разбивает задачу на структурированные запросы по графу зависимостей, охватывающему три типа компонентов (Данные, Визуализация, Взаимодействие) и три уровня абстракции (требование, спецификация, исполняемый объект). Работа фреймворка строится на двух механизмах:
- Progressive Nucleation (Прогрессивная нуклеация): вертикальная кристаллизация каждого запроса от уровня требования до исполняемого объекта в строгом порядке зависимостей.
- Semantic Annealing (Семантический отжиг): горизонтальная проверка согласованности между запросами на каждом уровне через слоистые логические проверки.
Результаты бенчмарка: разрыв с агентами
Эксперименты проводились на бенчмарке из 12 задач с использованием пяти передовых LLM. Crystalis демонстрирует статистически значимое превосходство над базовым агентиным подходом (agentic coding baseline), который генерирует код напрямую без структурной валидации.
| Метрика | Crystalis | Agentic Baseline |
|---|---|---|
| End-to-End Success Rate | до 75% | 8.3% |
| Количество задач | 12 | 12 |
| Тестирование пользователей | 12 практиков подтвердили удобство | Информация недостаточна |
Значение для индустрии
Результаты подтверждают, что для надежной генерации сложных аналитических интерфейсов недостаточно просто «попросить LLM написать код». Необходима явная декомпозиция задачи и итеративное уточнение (iterative refinement). Пользовательское исследование с участием 12 специалистов подтвердило, что такой подход не только повышает техническую корректность, но и делает процесс создания визуализаций более предсказуемым и удобным для конечных пользователей.
Источник: arXiv cs.AI ↗
