Исследования10 августа 2026 г., 09:17 МСК🤖 Auto

C4: Тест на креативность MLLM, где лучшие модели набирают лишь 50%

Исследователи представили C4 — первую систему оценки креативного понимания через китайские идиомы (Чэнъю). Результаты показали, что даже передовые MLLMs не способны надежно декодировать сложные концептуальные связи.

Баннер новости 5409

Проблема оценки креативности

Оценка креативных способностей мультимодальных больших языковых моделей (MLLMs) остается сложной задачей из-за отсутствия четких метрик и сигналов вознаграждения, характерных для задач, ориентированных на точность. Авторы работы предлагают новый подход: рассматривать креативность как способность к «перепрыгиванию» между концептами. Введение фреймворка C4 (Cross-Concept Creativity) позволяет измерить, насколько хорошо модель понимает скрытые смысловые связи в китайских идиомах (Чэнъю).

Методология: Кодирование и Декодирование

C4 операционализирует процесс через два этапа:

  • Кодирование: Целевые слоты в идиомах заменяются на визуализируемые концепты, соединенные «мостовыми путями» (bridge paths) в аннотированной сети концептов.
  • Декодирование: Модель должна восстановить исходный смысл, пройдя по этим путям.

Сложность заданий индексируется количеством мостов и их глубиной. Набор данных C4-Eval включает 184 синтетических и 37 созданных человеком примеров, каждый из которых протестирован в 5 различных настройках, что дало 884 случая восстановления ответа.

Результаты бенчмарка

Тестирование проводилось на десяти различных MLLMs. Результаты выявили существенный разрыв между закрытыми и открытыми моделями, а также общую неспособность систем к глубокому концептуальному пониманию.

Тип модели Лучший результат (Primary Accuracy) Примечание
Закрытые MLLMs (Closed) 50.7% Лидер бенчмарка
Закрытые MLLMs (Closed) 48.0% Второй результат
Открытые MLLMs (Open-source) Значительно ниже Существенный отставание от лидеров

Влияние подсказок и ограничений

Авторы исследовали, как различные типы помощи влияют на результат:

  • Кандидатные ограничения (Candidate constraints): Привели к резкому скачку точности, что указывает на то, что проблема часто кроется в поиске, а не в понимании.
  • Подсказки по мостам (Bridge hints) и запросы объяснений: Дали лишь modest (умеренный) прирост. Это критически важно: даже если модель «видит» путь, она не всегда может логически обосновать креативный скачок.

Почему это важно

Результаты C4 обнажают фундаментальный пробел в текущих архитектурах MLLMs. Способность к «рецептивной креативности» — умению восстанавливать намеренный смысл из неочевидных связей — остается слабой стороной. Для сфер дизайна, образования и человеческого-машинного взаимодействия это означает, что современные модели пока не могут быть полноценными партнерами в творческих процессах, требующих глубокого семантического анализа.

Источник: arXiv cs.AI ↗