Исследования29 июля 2026 г., 08:18 МСК🤖 Auto

Crystalis: LLM-генерация графиков с точностью 75% против 8% у агентов

Исследователи представили фреймворк Crystalis, решающий проблему согласованности в мульти-видовых визуализациях. Метод достигает 75% успеха, превосходя агентов в 9 раз.

Баннер новости 4606

Проблема согласованности в LLM-визуализации

Большие языковые модели (LLM) умеют генерировать отдельные диаграммы, но сталкиваются с крахом при создании Coordinated Multi-View Visualizations (CMV) — систем, где несколько графиков связаны общим потоком данных и взаимодействиями. Основная проблема заключается в «жесткой связности» (tight field-level coupling): ошибка в трансформации данных или визуальном кодировании автоматически делает невалидными все связанные компоненты. Традиционные end-to-end подходы зависят от случайных факторов, таких как доменные знания пользователя, и часто терпят неудачу.

Архитектура Crystalis: нуклеация и отжиг

Команда авторов (Dazhen Deng, Zhaoping He и др.) предложила фреймворк Crystalis, основанный на моделировании запросов (query-centric). Система разбивает задачу на структурированные запросы по графу зависимостей, охватывающему три типа компонентов (Данные, Визуализация, Взаимодействие) и три уровня абстракции (требование, спецификация, исполняемый объект). Работа фреймворка строится на двух механизмах:

  • Progressive Nucleation (Прогрессивная нуклеация): вертикальная кристаллизация каждого запроса от уровня требования до исполняемого объекта в строгом порядке зависимостей.
  • Semantic Annealing (Семантический отжиг): горизонтальная проверка согласованности между запросами на каждом уровне через слоистые логические проверки.

Результаты бенчмарка: разрыв с агентами

Эксперименты проводились на бенчмарке из 12 задач с использованием пяти передовых LLM. Crystalis демонстрирует статистически значимое превосходство над базовым агентиным подходом (agentic coding baseline), который генерирует код напрямую без структурной валидации.

Метрика Crystalis Agentic Baseline
End-to-End Success Rate до 75% 8.3%
Количество задач 12 12
Тестирование пользователей 12 практиков подтвердили удобство Информация недостаточна

Значение для индустрии

Результаты подтверждают, что для надежной генерации сложных аналитических интерфейсов недостаточно просто «попросить LLM написать код». Необходима явная декомпозиция задачи и итеративное уточнение (iterative refinement). Пользовательское исследование с участием 12 специалистов подтвердило, что такой подход не только повышает техническую корректность, но и делает процесс создания визуализаций более предсказуемым и удобным для конечных пользователей.

Источник: arXiv cs.AI ↗