От уверенности к ответственности
Мультимодальные большие языковые модели (MLLM) все чаще используются в задачах, где ошибка стоит дорого: от анализа медицинских снимков до работы с финансовыми графиками. Проблема в том, что «гладкий» ответ не гарантирует правильности. Модель может ошибиться из-за плохого качества входных данных, перцептивных ошибок, конфликта между модальностями или сдвига распределения данных. Исследователи Abderrahmene Boudiaf, Irfan Hussain и Sajid Javed (17 августа 2026 г.) предлагают новый подход: неопределенность должна быть не просто числом, а сигналом для принятия решений.
Архитектура принятия решений
Авторы структурируют литературу вокруг фреймворка, где неопределенность напрямую влияет на поведение системы. Источник неопределенности генерирует наблюдаемые сигналы, которые должны быть откалиброваны для оценки риска. На основе этого калиброванного уровня неопределенности система выбирает действие. Это смещает фокус с простого «узнавания» на «управление» рисками.
Инструментарий и метрики
Обзор охватывает широкий спектр методов оценки, от низкоуровневых до высокоуровневых. Ключевые подходы включают:
- Token и logit uncertainty: анализ вероятностных распределений на уровне токенов.
- Semantic disagreement: выявление расхождений в интерпретации данных.
- Perturbation instability: оценка стабильности ответа при небольших изменениях входа.
- Verbalized confidence: явное выражение уверенности текстом.
- Conformal prediction: статистические гарантии корректности.
Практические стратегии действий
Главный тезис работы: неопределенность должна определять, что делает система. Авторы классифицируют стратегии реагирования на высокий риск:
| Стратегия | Описание | Применение |
|---|---|---|
| Abstention (Отказ) | Модель отказывается отвечать на вопрос | Высокорисковые задачи, отсутствие данных |
| Clarification (Уточнение) | Запрос дополнительной информации у пользователя | Неоднозначные запросы, конфликт модальностей |
| Escalation (Эскалация) | Передача задачи человеку или более мощной модели | Критические решения, сложные рассуждения |
| Retrieval (Поиск) | Активный поиск дополнительных доказательств | Недостаток контекста в исходных данных |
Открытые проблемы
Исследователи выделяют ряд нерешенных задач, которые необходимо решить для внедрения MLLM в критическую инфраструктуру. Среди них: source-aware decomposition (разделение источников неопределенности), action-aware benchmarks (бенчмарки, оценивающие действия, а не только ответы), калибровка при сдвиге распределения и воспроизводимая отчетность. Без решения этих проблем MLLM останутся «черными ящиками», чья уверенность не поддается проверке.
Источник: arXiv cs.CL ↗
