Проблема оценки креативности
Оценка креативных способностей мультимодальных больших языковых моделей (MLLMs) остается сложной задачей из-за отсутствия четких метрик и сигналов вознаграждения, характерных для задач, ориентированных на точность. Авторы работы предлагают новый подход: рассматривать креативность как способность к «перепрыгиванию» между концептами. Введение фреймворка C4 (Cross-Concept Creativity) позволяет измерить, насколько хорошо модель понимает скрытые смысловые связи в китайских идиомах (Чэнъю).
Методология: Кодирование и Декодирование
C4 операционализирует процесс через два этапа:
- Кодирование: Целевые слоты в идиомах заменяются на визуализируемые концепты, соединенные «мостовыми путями» (bridge paths) в аннотированной сети концептов.
- Декодирование: Модель должна восстановить исходный смысл, пройдя по этим путям.
Сложность заданий индексируется количеством мостов и их глубиной. Набор данных C4-Eval включает 184 синтетических и 37 созданных человеком примеров, каждый из которых протестирован в 5 различных настройках, что дало 884 случая восстановления ответа.
Результаты бенчмарка
Тестирование проводилось на десяти различных MLLMs. Результаты выявили существенный разрыв между закрытыми и открытыми моделями, а также общую неспособность систем к глубокому концептуальному пониманию.
| Тип модели | Лучший результат (Primary Accuracy) | Примечание |
|---|---|---|
| Закрытые MLLMs (Closed) | 50.7% | Лидер бенчмарка |
| Закрытые MLLMs (Closed) | 48.0% | Второй результат |
| Открытые MLLMs (Open-source) | Значительно ниже | Существенный отставание от лидеров |
Влияние подсказок и ограничений
Авторы исследовали, как различные типы помощи влияют на результат:
- Кандидатные ограничения (Candidate constraints): Привели к резкому скачку точности, что указывает на то, что проблема часто кроется в поиске, а не в понимании.
- Подсказки по мостам (Bridge hints) и запросы объяснений: Дали лишь modest (умеренный) прирост. Это критически важно: даже если модель «видит» путь, она не всегда может логически обосновать креативный скачок.
Почему это важно
Результаты C4 обнажают фундаментальный пробел в текущих архитектурах MLLMs. Способность к «рецептивной креативности» — умению восстанавливать намеренный смысл из неочевидных связей — остается слабой стороной. Для сфер дизайна, образования и человеческого-машинного взаимодействия это означает, что современные модели пока не могут быть полноценными партнерами в творческих процессах, требующих глубокого семантического анализа.
Источник: arXiv cs.AI ↗
