Проблема «мусорных» бенчмарков
Знакомая ситуация: новые визуальные языковые модели (VLM) показывают рекордные баллы в тестах, но на практике не могут связать изображение с внешними знаниями. Исследование Qian Ma и соавторов (принято в ECCV 2026) доказывает, что причина кроется не в слабости моделей, а в дефектах самих бенчмарков Knowledge-Based VQA (KB-VQA). Авторы выявили, что метрика точности ответа (accuracy) является ложным прокси-индикатором, так как опирается на три нарушаемых допущения: наличие ответа в базе знаний, корректность формулировки вопроса и необходимость визуальной амбигуации.
Аудит: цифры и факты
Команда провела детальный аудит существующих наборов данных и нашла критические системные сбои. Оказалось, что многие вопросы сформулированы так, что они не требуют сложного сопоставления «визуальное изображение — знание», а ответы часто либо отсутствуют в базе, либо противоречат друг другу. Это позволяет моделям «угадывать» ответы, не выполняя реального логического вывода.
| Категория проблемы | Суть дефекта | Влияние на оценку |
|---|---|---|
| Отсутствие ответа | Правильный ответ не может быть выведен из предоставленной базы знаний | Невозможно проверить истинность ответа модели |
| Противоречия | В базе знаний содержатся конфликтующие данные для одного объекта | Модель получает «шум», снижающий объективность метрики |
| Неоднозначность вопросов | Вопросы не имеют достаточных ограничений (underspecified) | Модель может дать верный ответ случайно |
| Визуальная тривиальность | Сцены содержат один объект, не требующий дисамбигуации | Игнорируется способность к сложному mapping'у |
Решение: аудит, ремонт и аугментация
Для исправления ситуации авторы разработали протокол из двух этапов. Во-первых, audit-and-repair — восстановление связности «вопрос-база знаний» и уточнение формулировок. Во-вторых, controlled multi-entity augmentation — добавление визуальной неоднозначности через сцены с несколькими объектами, что заставляет модель реально искать и сопоставлять знания, а не просто искать совпадения.
Почему это важно
Переоценка моделей на исправленных и дополненных данных показала кардинально иные тренды производительности. То, что ранее считалось «высоким уровнем рассуждения», оказалось простым совпадением. Это исследование требует пересмотра стандартов оценки VLM: от простого сопоставления ответов к верифицируемому логическому выводу, учитывающему взаимодействие с внешним контекстом.
Источник: arXiv cs.CL ↗
