Суть проблемы: модель знает, но молчит
Визуально-языковые модели (VLM) часто галлюцинируют, утверждая наличие объектов, которых нет на изображении. Автор исследования, используя метод J-lens от Anthropic, проанализировал внутреннее состояние модели LLaVA-1.5-7B. Выяснилось, что галлюцинация — это не сбой восприятия, а ошибка извлечения данных. Модель действительно «видит» объекты, но при формате вопроса «Да/Нет» её ответ подавляется сильным смещением в сторону согласия (yes-bias).
Эксперимент: 39/39 ошибок в бинарном выборе
При запросе «Есть ли на фото лампа?» к 39 изображениям без ламп, модель 39 раз ответила «Да». Однако анализ через J-lens показал, что сигнал об отсутствующей лампе в внутреннем пространстве (workspace) слабее сигнала реальных объектов примерно в 10 раз. При этом, если задать вопрос с выбором из двух вариантов, точность резко возрастает.
| Тип запроса | Результат | Точность / Комментарий |
|---|---|---|
| Бинарный вопрос (Есть ли X?) | 39/39 ответов «Да» | 100% галлюцинаций на пустых изображениях |
| Выбор из двух (X или Y?) | 38/39 и 37/39 | Высокая точность; модель использует визуальные данные |
| Ранг слова «Лампа» в J-space | 111 (отсутствует) vs 16 (присутствует) | Сигнал реальных объектов значительно сильнее |
Редактирование реальности: swap концепций
J-lens позволяет не только читать, но и изменять внутреннее представление. Исследователь смог «подменить» концепции в активациях модели. При замене направления «собака» на «кошка» (параметр α ≈ 1.25–1.5), модель начала описывать далматинца как «кошку с черными и белыми пятнами». Важно: модель сохранила визуальные детали (пятна), но изменила категорию. При замене «машины» на «самолет» добавился контекст неба, которого не было на фото, что указывает на перенос семантических связей.
Технические детали и выводы
Исследование использовало 39 изображений и 13 категорий объектов. Анализ показал, что визуальный энкодер CLIP имеет слабый «словесный канал», который становится читаемым после калибровки. Кривая принятия решения «Да/Нет» становится положительной уже с 13-го слоя, достигая пика на 20-м, что происходит независимо от наличия объекта на картинке. Это подтверждает гипотезу: модель линейно читаема, но её выходной токен подавляется архитектурным bias-ом при бинарных вопросах.
Источник: LessWrong ↗
