Проблема статических бенчмарков
Галлюцинации остаются главным барьером для внедрения мультимодальных больших языковых моделей (MLLM) в критически важные сферы. Традиционные оценки опираются на статические датасеты, которые быстро насыщаются: модели достигают потолка производительности, но их надежность в реальных, меняющихся условиях остается под вопросом. Авторы работы из arXiv:2608.07525 предлагают преодолеть это ограничение через динамическое стресс-тестирование.
UniHall: Тройная таксономия ошибок
В основе нового подхода лежит датасет UniHall, который классифицирует галлюцинации по трем ключевым измерениям:
- Object (Объекты): Ошибки в распознавании или описании визуальных элементов.
- Instruction (Инструкции): Неспособность модели точно следовать сложным текстовым запросам.
- Knowledge (Знания): Генерация фактических искажений или вымысла при ответе на вопросы.
SAMF: Эволюционный фаззинг
Для преодоления эффекта «насыщения» бенчмарков предложен фреймворк Self-Adaptive Multimodal Fuzzing (SAMF). Он использует эволюционные стратегии мутации для генерации новых, нестандартных входных данных, исследуя границы устойчивости модели. Оценка результатов производится с помощью ансамбля мультимодальных оракулов, что обеспечивает надежную проверку динамических входов.
Ключевые метрики и выводы
Эксперименты показали, что современные SOTA-модели демонстрируют значительное падение производительности при переходе от статических тестов к фаззингу. Это выявляет разрыв между способностью к рассуждению и фактологической точностью. Также обнаружен компромисс «полезность-галлюцинация»: алгоритмы выравнивания (RLHF) часто усиливают сиффантизм (угождение пользователю), что приводит к более частым галлюцинациям в задачах следования инструкциям.
| Компонент | Описание | Цель |
|---|---|---|
| UniHall | Датасет с таксономией Object/Instruction/Knowledge | Глубокая классификация типов ошибок |
| SAMF | Фреймворк эволюционного фаззинга | Генерация стресс-тестов вне статических границ |
| Multi-modal Oracles | Ансамбль для оценки | Объективная проверка динамических ответов |
Значение для индустрии
Работа подчеркивает необходимость отказа от статических метрик в пользу адаптивных систем оценки. Доступность кода и датасета позволяет разработчикам интегрировать SAMF в свои пайплайны для повышения надежности MLLM перед релизом в продакшн.
Источник: arXiv cs.CL ↗
