Исследования10 июля 2026 г., 04:16 МСК🤖 Auto

Взлом галлюцинаций VLM: J-lens раскрывает правду LLaVA

Исследование показало, что LLaVA-1.5-7B не «не видит» объекты, а игнорирует их из-за yes-bias. Метод J-lens позволил прочитать и редактировать внутреннее состояние модели.

Баннер новости 3260

Суть проблемы: модель знает, но молчит

Визуально-языковые модели (VLM) часто галлюцинируют, утверждая наличие объектов, которых нет на изображении. Автор исследования, используя метод J-lens от Anthropic, проанализировал внутреннее состояние модели LLaVA-1.5-7B. Выяснилось, что галлюцинация — это не сбой восприятия, а ошибка извлечения данных. Модель действительно «видит» объекты, но при формате вопроса «Да/Нет» её ответ подавляется сильным смещением в сторону согласия (yes-bias).

Эксперимент: 39/39 ошибок в бинарном выборе

При запросе «Есть ли на фото лампа?» к 39 изображениям без ламп, модель 39 раз ответила «Да». Однако анализ через J-lens показал, что сигнал об отсутствующей лампе в внутреннем пространстве (workspace) слабее сигнала реальных объектов примерно в 10 раз. При этом, если задать вопрос с выбором из двух вариантов, точность резко возрастает.

Тип запроса Результат Точность / Комментарий
Бинарный вопрос (Есть ли X?) 39/39 ответов «Да» 100% галлюцинаций на пустых изображениях
Выбор из двух (X или Y?) 38/39 и 37/39 Высокая точность; модель использует визуальные данные
Ранг слова «Лампа» в J-space 111 (отсутствует) vs 16 (присутствует) Сигнал реальных объектов значительно сильнее

Редактирование реальности: swap концепций

J-lens позволяет не только читать, но и изменять внутреннее представление. Исследователь смог «подменить» концепции в активациях модели. При замене направления «собака» на «кошка» (параметр α ≈ 1.25–1.5), модель начала описывать далматинца как «кошку с черными и белыми пятнами». Важно: модель сохранила визуальные детали (пятна), но изменила категорию. При замене «машины» на «самолет» добавился контекст неба, которого не было на фото, что указывает на перенос семантических связей.

Технические детали и выводы

Исследование использовало 39 изображений и 13 категорий объектов. Анализ показал, что визуальный энкодер CLIP имеет слабый «словесный канал», который становится читаемым после калибровки. Кривая принятия решения «Да/Нет» становится положительной уже с 13-го слоя, достигая пика на 20-м, что происходит независимо от наличия объекта на картинке. Это подтверждает гипотезу: модель линейно читаема, но её выходной токен подавляется архитектурным bias-ом при бинарных вопросах.

Источник: LessWrong ↗