Проблема «стеклянного потолка» в кулинарном ИИ
Мультимодальные языковые модели (MLLM) демонстрируют почти идеальные результаты на стандартных задачах распознавания еды, однако исследователи из команды Bo Zeng и коллег выяснили, что это часто является визуальным совпадением, а не глубоким пониманием. Для проверки этого гипотезы они представили CulturalMenuBench — первый крупный бенчмарк, оценивающий способность моделей применять культурные знания через визуальный ввод.
Масштаб и структура датасета
Коллекция включает 4 870 образцов, охватывающих 10 языков и 18 регионов мира. Задачи разделены на 10 категорий, где модели необходимо сопоставить финальное блюдо и пошаговые изображения готовки с ингредиентами, текстовыми инструкциями и региональной принадлежностью. Это позволяет тестировать не только «что это», но и «как и где это готовят».
Ключевые метрики: разрыв в знаниях
Тестирование 12 передовых моделей выявило критический разрыв между распознаванием и атрибуцией. Если на стандартных тестах с множественным выбором точность превышала 94%, то при определении региональной кухни (например, китайской) она падала до 56% и ниже, несмотря на идентичный формат ответа. Это указывает на то, что модель «знает» блюдо, но не может активировать культурный контекст только по картинке.
| Метрика / Задача | Результат модели | Интерпретация |
|---|---|---|
| Стандартное распознавание (MCQ) | > 94% | Высокая визуальная точность |
| Атрибуция региональной кухни (по фото) | ≤ 56% | Критический спад точности |
| Атрибуция по названию блюда | +7-18 п.п. выше | Знания есть, но не активируются визуально |
Диагностика ошибок
Анализ паттернов ошибок показал, что в сложных задачах модели часто работают на уровне случайного угадывания. Точность коррелирует с визуальной уникальностью блюда, а не со структурой культурных данных. Аугментация, удаляющая пошаговые изображения готовки, избирательно ухудшала результаты в задачах, требующих понимания процесса, подтверждая, что последовательность действий критически важна для культурного вывода.
Выводы для индустрии
Работа, принятая в EMNLP 2026 Findings, доказывает, что текущие подходы к обучению MLLM часто игнорируют связь между восприятием, процедурой и культурным контекстом. Для создания по-настоящему интеллектуальных систем необходимо явно обучать модели связывать визуальные признаки с процедурными и культурными данными, а не полагаться только на статистическое совпадение пикселей.
Источник: arXiv cs.AI ↗
