Релиз модели13 июля 2026 г., 05:16 МСК🤖 Auto

NeuroVFM: 5.24 млн снимков и 92.6% точности в триаж

Университет Мичигана представил NeuroVFM — фундаментальную модель для нейровизуализации, обученную на 5.24 млн клинических МРТ и КТ. Модель превосходит GPT-5 в триаже и работает в 24 раза дешевле.

Баннер новости 3423

Проблема данных и решение Vol-JEPA

Общие визуальные модели плохо справляются с анализом мозга, так как клинические снимки (МРТ/КТ) содержат идентифицируемые данные и редко встречаются в публичном интернете. Команда из Университета Мичигана решила эту проблему, обучив модель NeuroVFM на датасете UM-NeuroImages, включающем 5.24 миллиона объемных снимков из 566 915 исследований за два десятилетия.

В основе лежит алгоритм Vol-JEPA (Volume Joint Embedding Predictive Architecture). В отличие от традиционных подходов, он не реконструирует пиксели и не требует текстовых отчетов радиологов. Модель токенизирует 3D-объемы в патчи 4×16×16 вокселей и предсказывает латентные представления замаскированных областей. Маскирование сфокусировано на переднем плане (голова), что заставляет сеть изучать нейроанатомию, а не фоновые артефакты.

Результаты: сравнение с лидерами

Модель показала выдающиеся результаты на 156 диагностических задачах (74 МРТ, 82 КТ), используя метрику макросреднего AUROC. NeuroVFM превзошла все базовые модели, включая специализированные архитектуры, обученные на тех же данных.

Модель Данные для обучения Цель обучения AUROC (CT / MRI)
NeuroVFM UM-NeuroImages (5.24M) Vol-JEPA (латентное предсказание) 92.68 / 92.49
HLIP UM-NeuroImages Языковой надзор (отчеты) −0.98 (отставание)
NeuroMAE UM-NeuroImages Реконструкция вокселей (MAE) −1.55 (отставание)
DINOv3 1.7B естественных изображений Самоконтроль (2D) −2.24 (отставание)
BiomedCLIP 15M пар изображение-текст Зрение-язык (2D) −2.88 (отставание)

Генерация отчетов: победа над GPT-5

Самое впечатляющее применение — связка NeuroVFM с языковой моделью Qwen3-14B (архитектура LLaVA-1.5). Система не только генерирует структурированные выводы, но и проводит триаж (сортировку по срочности). В проспективном исследовании на 1155 пациентах NeuroVFM-LLaVA показала 92.6% сбалансированной точности триажа против 71.2% у GPT-5.

Метрика NeuroVFM-LLaVA GPT-5 Claude Sonnet 4.5
Точность трехуровневого триажа Best (92.6%) 71.2%
Уровень пропущенных критических находок 13.5% (21/155) 50.3% (78/155)
Стоимость инференса Baseline >24× дороже

Эффективность и ограничения

Модель обучалась менее чем на 1000 GPU-часов, что в 7 раз быстрее базовой модели 3DINO, при этом она использует всего 85.8 млн параметров (базовая версия). Генерация отчетов на базе NeuroVFM в 24 раза дешевле и в 23 раза менее энергоемка, чем использование GPT-5.

Однако у системы есть ограничения: чувствительность триажа составляет 86.5%, что означает риск пропуска критических случаев. Модель не одобрена FDA, весы распространяются по лицензии CC-BY-NC-SA-4.0 (некоммерческое использование), а результаты получены в рамках одной академической системы здравоохранения. Авторы позиционируют NeuroVFM как инструмент поддержки принятия решений, а не автономную систему скрининга.

Бенчмарки

БенчмаркNeuroVFMNeuroVFM-LLaVADINOv3GPT-5HLIPNeuroMAEPRIMA
AUROC (CT)92.68%93.66%94.23%96.55%
AUROC (MRI)92.49%94.73%93.47%94.04%
Prospective balanced accuracy92.6%71.2%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗