Проблема «потери объема»
Ключевой вывод исследования — фундаментальное несоответствие представлений. Клиническая интерпретация требует полного пространственного контекста (3D) и количественных данных, зависящих от метода съемки. Однако современные MLLM (Multimodal Large Language Models) чаще всего работают с отобранными 2D-снимками, сжатыми визуальными репрезентациями или текстом из отчетов. Это приводит к потере критически важной информации о структуре тканей и патологиях, которые видны только в объеме.
Анализ 200+ публикаций
Команда из 19 авторов (включая исследователей из ведущих институтов) систематизировала литературу по трем направлениям:
- Модельный уровень: Объемные фундаментальные модели (Volumetric Foundation Models) и стратегии сжатия/выравнивания с языком.
- Системный уровень: Агентные системы (Agentic Systems), использующие планирование, инструменты, память и взаимодействие с рабочими процессами.
- Клинический уровень: Оценка того, где достаточно 2D-взгляда, а где требуется нативное 3D-моделирование.
Фреймворк Claim-Design-Validation
Авторы предлагают новый подход к оценке надежности AI. Техническое утверждение (Claim) должно быть согласовано с архитектурой (Design) и валидацией (Validation). Без «достоверного объемного представления» и прослеживаемого поведения системы клиническая достоверность невозможна.
Сравнение подходов
| Параметр | Стандартные MLLM (2D/Text) | Нативные 3D-радиологические AI |
|---|---|---|
| Входные данные | Отдельные 2D-срезы, текстовые отчеты | Полные 3D-объемы (DICOM), метаданные сканирования |
| Пространственный контекст | Локальный (в пределах кадра) | Глобальный (в пределах органа/тела) |
| Количественный анализ | Ограничен или отсутствует | Точные измерения объемов, плотности, формы |
| Роль человека | Минимальная (после фильтрации) | Контроль сложных случаев, верификация |
Вывод для индустрии
Использование MLLM в радиологии оправдано только там, где задача не требует глубокого пространственного анализа. Для сложных случаев (онкология, неврология) необходимы системы с нативным 3D-моделированием и агентными функциями, способными интегрироваться в клинический workflow, а не просто генерировать тексты на основе 2D-изображений.
Источник: arXiv cs.AI ↗
