Исследования4 сентября 2026 г., 12:18 МСК🤖 Auto

CulturalMenuBench: ИИ видит еду, но не понимает культуру

Новый бенчмарк CulturalMenuBench доказал, что мультимодальные модели теряют до 40% точности при переходе от распознавания блюд к культурному контексту.

Баннер новости 6763

Проблема «стеклянного потолка» в кулинарном ИИ

Мультимодальные языковые модели (MLLM) демонстрируют почти идеальные результаты на стандартных задачах распознавания еды, однако исследователи из команды Bo Zeng и коллег выяснили, что это часто является визуальным совпадением, а не глубоким пониманием. Для проверки этого гипотезы они представили CulturalMenuBench — первый крупный бенчмарк, оценивающий способность моделей применять культурные знания через визуальный ввод.

Масштаб и структура датасета

Коллекция включает 4 870 образцов, охватывающих 10 языков и 18 регионов мира. Задачи разделены на 10 категорий, где модели необходимо сопоставить финальное блюдо и пошаговые изображения готовки с ингредиентами, текстовыми инструкциями и региональной принадлежностью. Это позволяет тестировать не только «что это», но и «как и где это готовят».

Ключевые метрики: разрыв в знаниях

Тестирование 12 передовых моделей выявило критический разрыв между распознаванием и атрибуцией. Если на стандартных тестах с множественным выбором точность превышала 94%, то при определении региональной кухни (например, китайской) она падала до 56% и ниже, несмотря на идентичный формат ответа. Это указывает на то, что модель «знает» блюдо, но не может активировать культурный контекст только по картинке.

Метрика / Задача Результат модели Интерпретация
Стандартное распознавание (MCQ) > 94% Высокая визуальная точность
Атрибуция региональной кухни (по фото) ≤ 56% Критический спад точности
Атрибуция по названию блюда +7-18 п.п. выше Знания есть, но не активируются визуально

Диагностика ошибок

Анализ паттернов ошибок показал, что в сложных задачах модели часто работают на уровне случайного угадывания. Точность коррелирует с визуальной уникальностью блюда, а не со структурой культурных данных. Аугментация, удаляющая пошаговые изображения готовки, избирательно ухудшала результаты в задачах, требующих понимания процесса, подтверждая, что последовательность действий критически важна для культурного вывода.

Выводы для индустрии

Работа, принятая в EMNLP 2026 Findings, доказывает, что текущие подходы к обучению MLLM часто игнорируют связь между восприятием, процедурой и культурным контекстом. Для создания по-настоящему интеллектуальных систем необходимо явно обучать модели связывать визуальные признаки с процедурными и культурными данными, а не полагаться только на статистическое совпадение пикселей.

Источник: arXiv cs.AI ↗