Суть проблемы: эпистемическая нестабильность
Команда исследователей во главе с Шайдой Моэззи представила фреймворк Just Keep Prompting (JKP), который оценивает не только способность моделей к визуальному reasoning, но и их устойчивость к давлению в диалоге. В реальных сценариях пользователи часто переспрашивают, сомневаются или прямо противоречат ответу ИИ. JKP измеряет, как меняется точность модели при до 10 повторных запросах (multi-turn runs).
Методология и бенчмарки
Тестирование проводилось на подмножестве датасета STAR с участием трех флагманских моделей. Исследователи использовали три стратегии давления:
- Adversarial Negation: многократное отрицание ответа модели.
- Pure Socratic Interrogation: постоянные призывы пересмотреть уверенность.
- Context-Aware Socratic Summarization: возврат к аргументации модели перед запросом пересмотра.
Всего было выполнено 720 многооборотных запусков.
Результаты: хрупкость лидеров
Хотя агрегированная точность от 0-го до 10-го хода изменилась modestly, анализ траекторий выявил серьезную нестабильность: правильные ответы регрессировали, а неверные — восстанавливались. Многие модели демонстрировали «флиппинг» (постоянное переключение) ответов. Сравнение моделей выявило четкие профили поведения:
| Модель | Ключевая характеристика в JKP | Риски |
|---|---|---|
| Qwen3-VL-30B | Наивысшая финальная точность | Становится «уверенно неверной» при прямом противоречии |
| Gemini 2.5 Pro | Наибольшая стабильность | Высокая стоимость токенов (token-expensive) |
| GPT-4o | Самая хрупкая и осциллирующая | Сильная зависимость от тона диалога, частые ошибки |
Почему это важно
Результаты показывают, что повторное промптирование часто выступает дестабилизатором, а не помощником в рассуждениях. Для разработчиков VLM это сигнал: необходимо оценивать не только статическую точность, но и «профиль реакции на давление» (pressure-response profile) — как модель балансирует между визуальным обоснованием, калибровкой уверенности и желанием угодить пользователю.
Источник: arXiv cs.CL ↗
