Проблема данных и решение Vol-JEPA
Общие визуальные модели плохо справляются с анализом мозга, так как клинические снимки (МРТ/КТ) содержат идентифицируемые данные и редко встречаются в публичном интернете. Команда из Университета Мичигана решила эту проблему, обучив модель NeuroVFM на датасете UM-NeuroImages, включающем 5.24 миллиона объемных снимков из 566 915 исследований за два десятилетия.
В основе лежит алгоритм Vol-JEPA (Volume Joint Embedding Predictive Architecture). В отличие от традиционных подходов, он не реконструирует пиксели и не требует текстовых отчетов радиологов. Модель токенизирует 3D-объемы в патчи 4×16×16 вокселей и предсказывает латентные представления замаскированных областей. Маскирование сфокусировано на переднем плане (голова), что заставляет сеть изучать нейроанатомию, а не фоновые артефакты.
Результаты: сравнение с лидерами
Модель показала выдающиеся результаты на 156 диагностических задачах (74 МРТ, 82 КТ), используя метрику макросреднего AUROC. NeuroVFM превзошла все базовые модели, включая специализированные архитектуры, обученные на тех же данных.
| Модель | Данные для обучения | Цель обучения | AUROC (CT / MRI) |
|---|---|---|---|
| NeuroVFM | UM-NeuroImages (5.24M) | Vol-JEPA (латентное предсказание) | 92.68 / 92.49 |
| HLIP | UM-NeuroImages | Языковой надзор (отчеты) | −0.98 (отставание) |
| NeuroMAE | UM-NeuroImages | Реконструкция вокселей (MAE) | −1.55 (отставание) |
| DINOv3 | 1.7B естественных изображений | Самоконтроль (2D) | −2.24 (отставание) |
| BiomedCLIP | 15M пар изображение-текст | Зрение-язык (2D) | −2.88 (отставание) |
Генерация отчетов: победа над GPT-5
Самое впечатляющее применение — связка NeuroVFM с языковой моделью Qwen3-14B (архитектура LLaVA-1.5). Система не только генерирует структурированные выводы, но и проводит триаж (сортировку по срочности). В проспективном исследовании на 1155 пациентах NeuroVFM-LLaVA показала 92.6% сбалансированной точности триажа против 71.2% у GPT-5.
| Метрика | NeuroVFM-LLaVA | GPT-5 | Claude Sonnet 4.5 |
|---|---|---|---|
| Точность трехуровневого триажа | Best (92.6%) | 71.2% | — |
| Уровень пропущенных критических находок | 13.5% (21/155) | 50.3% (78/155) | — |
| Стоимость инференса | Baseline | >24× дороже | — |
Эффективность и ограничения
Модель обучалась менее чем на 1000 GPU-часов, что в 7 раз быстрее базовой модели 3DINO, при этом она использует всего 85.8 млн параметров (базовая версия). Генерация отчетов на базе NeuroVFM в 24 раза дешевле и в 23 раза менее энергоемка, чем использование GPT-5.
Однако у системы есть ограничения: чувствительность триажа составляет 86.5%, что означает риск пропуска критических случаев. Модель не одобрена FDA, весы распространяются по лицензии CC-BY-NC-SA-4.0 (некоммерческое использование), а результаты получены в рамках одной академической системы здравоохранения. Авторы позиционируют NeuroVFM как инструмент поддержки принятия решений, а не автономную систему скрининга.
Бенчмарки
| Бенчмарк | NeuroVFM | NeuroVFM-LLaVA | DINOv3 | GPT-5 | HLIP | NeuroMAE | PRIMA |
|---|---|---|---|---|---|---|---|
| AUROC (CT) | 92.68% | — | — | — | 93.66% | 94.23% | 96.55% |
| AUROC (MRI) | 92.49% | — | 94.73% | — | 93.47% | 94.04% | — |
| Prospective balanced accuracy | — | 92.6% | — | 71.2% | — | — | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
