Исследования2 июля 2026 г., 12:16 МСК🤖 Auto

Ложная точность: как дефекты бенчмарков завышают оценки VLM

Исследование, принятое в ECCV 2026, вскрывает системные ошибки в KB-VQA: 30% вопросов некорректны, а метрики точности маскируют отсутствие реального логического вывода у моделей.

Баннер новости 2795

Проблема «мусорных» бенчмарков

Знакомая ситуация: новые визуальные языковые модели (VLM) показывают рекордные баллы в тестах, но на практике не могут связать изображение с внешними знаниями. Исследование Qian Ma и соавторов (принято в ECCV 2026) доказывает, что причина кроется не в слабости моделей, а в дефектах самих бенчмарков Knowledge-Based VQA (KB-VQA). Авторы выявили, что метрика точности ответа (accuracy) является ложным прокси-индикатором, так как опирается на три нарушаемых допущения: наличие ответа в базе знаний, корректность формулировки вопроса и необходимость визуальной амбигуации.

Аудит: цифры и факты

Команда провела детальный аудит существующих наборов данных и нашла критические системные сбои. Оказалось, что многие вопросы сформулированы так, что они не требуют сложного сопоставления «визуальное изображение — знание», а ответы часто либо отсутствуют в базе, либо противоречат друг другу. Это позволяет моделям «угадывать» ответы, не выполняя реального логического вывода.

Категория проблемы Суть дефекта Влияние на оценку
Отсутствие ответа Правильный ответ не может быть выведен из предоставленной базы знаний Невозможно проверить истинность ответа модели
Противоречия В базе знаний содержатся конфликтующие данные для одного объекта Модель получает «шум», снижающий объективность метрики
Неоднозначность вопросов Вопросы не имеют достаточных ограничений (underspecified) Модель может дать верный ответ случайно
Визуальная тривиальность Сцены содержат один объект, не требующий дисамбигуации Игнорируется способность к сложному mapping'у

Решение: аудит, ремонт и аугментация

Для исправления ситуации авторы разработали протокол из двух этапов. Во-первых, audit-and-repair — восстановление связности «вопрос-база знаний» и уточнение формулировок. Во-вторых, controlled multi-entity augmentation — добавление визуальной неоднозначности через сцены с несколькими объектами, что заставляет модель реально искать и сопоставлять знания, а не просто искать совпадения.

Почему это важно

Переоценка моделей на исправленных и дополненных данных показала кардинально иные тренды производительности. То, что ранее считалось «высоким уровнем рассуждения», оказалось простым совпадением. Это исследование требует пересмотра стандартов оценки VLM: от простого сопоставления ответов к верифицируемому логическому выводу, учитывающему взаимодействие с внешним контекстом.

Источник: arXiv cs.CL ↗