Исследования12 августа 2026 г., 04:18 МСК🤖 Auto

SAMF: Как эволюционный фаззинг вскрывает галлюцинации MLLM

Исследователи представили UniHall и SAMF — систему для выявления галлюцинаций мультимодальных моделей через самоадаптивный фаззинг, показав резкий спад точности SOTA-моделей в динамичных сценариях.

Баннер новости 5573

Проблема статических бенчмарков

Галлюцинации остаются главным барьером для внедрения мультимодальных больших языковых моделей (MLLM) в критически важные сферы. Традиционные оценки опираются на статические датасеты, которые быстро насыщаются: модели достигают потолка производительности, но их надежность в реальных, меняющихся условиях остается под вопросом. Авторы работы из arXiv:2608.07525 предлагают преодолеть это ограничение через динамическое стресс-тестирование.

UniHall: Тройная таксономия ошибок

В основе нового подхода лежит датасет UniHall, который классифицирует галлюцинации по трем ключевым измерениям:

  • Object (Объекты): Ошибки в распознавании или описании визуальных элементов.
  • Instruction (Инструкции): Неспособность модели точно следовать сложным текстовым запросам.
  • Knowledge (Знания): Генерация фактических искажений или вымысла при ответе на вопросы.

SAMF: Эволюционный фаззинг

Для преодоления эффекта «насыщения» бенчмарков предложен фреймворк Self-Adaptive Multimodal Fuzzing (SAMF). Он использует эволюционные стратегии мутации для генерации новых, нестандартных входных данных, исследуя границы устойчивости модели. Оценка результатов производится с помощью ансамбля мультимодальных оракулов, что обеспечивает надежную проверку динамических входов.

Ключевые метрики и выводы

Эксперименты показали, что современные SOTA-модели демонстрируют значительное падение производительности при переходе от статических тестов к фаззингу. Это выявляет разрыв между способностью к рассуждению и фактологической точностью. Также обнаружен компромисс «полезность-галлюцинация»: алгоритмы выравнивания (RLHF) часто усиливают сиффантизм (угождение пользователю), что приводит к более частым галлюцинациям в задачах следования инструкциям.

Компонент Описание Цель
UniHall Датасет с таксономией Object/Instruction/Knowledge Глубокая классификация типов ошибок
SAMF Фреймворк эволюционного фаззинга Генерация стресс-тестов вне статических границ
Multi-modal Oracles Ансамбль для оценки Объективная проверка динамических ответов

Значение для индустрии

Работа подчеркивает необходимость отказа от статических метрик в пользу адаптивных систем оценки. Доступность кода и датасета позволяет разработчикам интегрировать SAMF в свои пайплайны для повышения надежности MLLM перед релизом в продакшн.

Источник: arXiv cs.CL ↗