Главная/Блог/Гайд/NeuroVFM: Революция в нейровизуализации…
Гайд9 мин чтения · 13 июля 2026 г.

NeuroVFM: Революция в нейровизуализации на базе Vol-JEPA

Разбираем фундаментальную модель NeuroVFM от Университета Мичигана, которая учится на 5.24 млн клинических снимков без аннотаций и превосходит аналоги в диагностике.

NeuroVFM: Революция в нейровизуализации на базе Vol-JEPA

В мире искусственного интеллекта, особенно в медицине, существует давняя проблема: как обучить модели на данных, которые по определению являются закрытыми? Клинические снимки МРТ и КТ содержат биометрические данные пациентов, что делает их недоступными для публичных интернет-скрейпингов. В результате передовые модели, обученные на открытых наборах данных, часто оказываются некомпетентными в специфических задачах нейровизуализации. Команда исследователей из Университета Мичигана предлагает элегантное решение этой дилеммы, публикуя результаты в авторитетном журнале Nature Medicine. Их продукт — NeuroVFM (Neuroimaging Foundation Model) — представляет собой первый в своем роде универсальный визуальный фундаментальный модель, обученный на «грязных», неструктурированных клинических данных.

Это не просто еще один классификатор заболеваний. NeuroVFM использует инновационный подход, который авторы называют «обучением через систему здравоохранения» (health system learning). Модель извлекает знания непосредственно из рутинных клинических операций, минуя необходимость в дорогостоящих и трудоемких аннотациях радиологов или текстовых отчетах. В этой статье мы подробно разберем архитектуру Vol-JEPA, на которой построена модель, ее выдающиеся результаты, практическое применение и ограничения, с которыми сталкиваются разработчики при внедрении таких систем в реальную клиническую практику.

Визуализация концепции Vol-JEPA и архитектуры NeuroVFM.
Визуализация концепции Vol-JEPA и архитектуры NeuroVFM.

01Что такое NeuroVFM и почему это важно?

В основе NeuroVFM лежит задача создания универсального визуального фундамента для нейровизуализации. Традиционные подходы к обучению медицинских ИИ-моделей часто сталкиваются с «бутылочным горлышком» аннотаций. Чтобы обучить модель распознавать патологии, обычно требуется пара «снимок — текстовый отчет радиолога» или ручная разметка областей интереса. Это дорого, долго и масштабируется плохо. NeuroVFM обходит эту проблему, используя подход самообучения (self-supervised learning) на огромном массиве неструктурированных данных.

Модель была обучена на 5,24 миллиона клинических объемов МРТ и КТ. Эти данные поступили из набора данных UM-NeuroImages, который включает 566 915 исследований, собранных в течение более чем двух десятилетий рутинной работы в Michigan Medicine. Такой масштаб и разнообразие данных позволяют модели выучить не просто паттерны конкретных болезней, а фундаментальные принципы строения человеческого мозга и черепной коробки. Это создает базу знаний, которая может быть адаптирована под множество downstream-задач (задач последующего использования) без необходимости переобучения всей архитектуры с нуля.

💡
Ключевая инновация. NeuroVFM не требует текстовых отчетов или меток классов для обучения. Она учится предсказывать скрытые представления (latents) внутри самого изображения, что позволяет использовать любые доступные клинические снимки, даже если они не были специально подготовлены для исследований.

02Архитектура Vol-JEPA: Как работает предсказание латентных пространств

Сердцем NeuroVFM является алгоритм Vol-JEPA (Volumetric Joint Embedding Predictive Architecture). Это развитие предыдущих методов I-JEPA и V-JEPA, адаптированное специально для трехмерных медицинских изображений. В отличие от традиционных автоэнкодеров, которые пытаются восстановить каждый пиксель (или воксель) исходного изображения, Vol-JEPA работает в латентном пространстве. Это означает, что модель не видит «картинку» в привычном смысле, а оперирует абстрактными векторными представлениями признаков.

Процесс обучения можно описать следующим образом:

  1. Токенизация: Каждый 3D-объем (снимок) разбивается на непересекающиеся патчи размером 4×16×16 вокселей. Это позволяет модели обрабатывать данные дискретными блоками, аналогично тому, как трансформеры работают с текстовыми токенами.
  2. Маскирование: Объем разделяется на видимый контекст (small visible context) и большую замаскированную цель (larger masked target). Для МРТ контекст составляет 25% объема, для КТ — 20%. Также применяется dropout патчей на уровне 20%.
  3. Кодирование и предсказание: Студенческий энкодер обрабатывает видимые патчи. Затем предиктор комбинирует латентные представления контекста с позиционными кодировками замаскированной области, чтобы предсказать латентные представления целевой области. Учителем выступает энкодер, который является экспоненциальным скользящим средним (EMA) от студента.
  4. Обучение: Минимизация потери L1 между предсказанными и истинными (сгенерированными учителем) латентными представлениями. Градиенты не распространяются через учителя, что стабилизирует обучение.

Важной особенностью является фокусировка маскирования на переднем плане (foreground-focused masking) с использованием предварительно вычисленных масок головы. Это заставляет модель концентрироваться на нейробиологической анатомии, а не на фоновых артефактах или технических деталях сканера. Такой подход обеспечивает более устойчивые и обобщаемые представления.

03Производительность: Сравнение с состоянием искусства

Для оценки эффективности NeuroVFM исследователи заморозили все энкодеры и обучили идентичные «зонды» (probes) уровня исследования. Основной метрикой выступало макросреднее значение площади под ROC-кривой (AUROC) по 156 диагностическим задачам, охватывающим 74 диагноза по МРТ и 82 по КТ. Результаты превзошли все существующие базовые модели.

NeuroVFM: Революция в нейровизуализации на базе Vol-JEPA

NeuroVFM достиг показателя 92.68 AUROC на КТ и 92.49 AUROC на МРТ. Что особенно примечательно, модель превзошла аналоги даже в тех случаях, когда те обучались на тех же данных. Это доказывает, что выбор архитектуры обучения (Vol-JEPA) важнее просто объема данных или наличия текстовых подписей.

Модель Данные для предобучения Цель обучения Разница в AUROC относительно NeuroVFM
NeuroVFM UM-NeuroImages (клинические) Vol-JEPA предсказание латентов — (92.68 КТ / 92.49 МРТ)
HLIP UM-NeuroImages Надзор по отчетам/языку −0.98
PRIMA UM-NeuroImages (только МРТ) Надзор по отчетам/языку −3.87
NeuroMAE UM-NeuroImages Восстановление вокселей (MAE) −1.55
DINOv3 1.7B естественных изображений Самообучение (2D) −2.24
BiomedCLIP 15M пар изображение-текст Зрение-язык (2D) −2.88

Как видно из таблицы, модели, использующие текстовые отчеты (HLIP, PRIMA) или восстановление вокселей (NeuroMAE), уступают NeuroVFM. Это подтверждает гипотезу авторов: предсказание латентных представлений в 3D-пространстве является более эффективным методом извлечения признаков для нейровизуализации, чем работа с текстом или пиксельное восстановление. Кроме того, модели, обученные на естественных изображениях (DINOv3) или общих биомедицинских парах (BiomedCLIP), показывают значительно худшие результаты, подчеркивая необходимость специализированного обучения на медицинских данных.

⚠️
Важно. Поскольку PRIMA, HLIP и NeuroMAE обучались на тех же данных UM-NeuroImages, разница в результатах изолирует влияние именно цели обучения (objective). Латентное предсказание объективно превосходит текстовый надзор и реконструкцию вокселей в данном контексте.

04Эффективность обучения и ресурсы

Помимо точности, NeuroVFM демонстрирует впечатляющую эффективность использования вычислительных ресурсов. Полное обучение Vol-JEPA потребовало менее 1000 часов работы GPU. Это в 7 раз быстрее, чем базовая модель 3DINO. Кроме того, архитектура позволяет использовать батчи в 16 раз больше при том же объеме памяти. Базовый энкодер содержит 85.8 миллионов параметров, а его облегченная версия (small variant) — всего 21.7 миллиона. Это делает модель доступной для развертывания даже на системах с ограниченными ресурсами, что критически важно для многих клиник и исследовательских центров.

05Что позволяет делать NeuroVFM: От диагностики к генерации отчетов

NeuroVFM — это не только инструмент для классификации заболеваний. Благодаря заморозке визуальных токенов, модель служит универсальным интерфейсом для множества downstream-задач. Вот ключевые направления применения:

  • Генерация отчетов: Команда объединила замороженный энкодер NeuroVFM с языковой моделью Qwen3-14B в стиле LLaVA-1.5. Система NeuroVFM-LLaVA способна генерировать структурированные ключевые выводы (key findings) на основе снимков.
  • Триаж (Triage): Выводы передаются в модель рассуждений, которая определяет уровень срочности: «незначительно», «рутинно» или «срочно». Это помогает радиологам расставлять приоритеты в очереди на просмотр.
  • Обоснованные предсказания (Grounded predictions): Используя пуллер MIL (Multiple Instance Learning) на основе внимания, система отображает выводы на конкретные области изображения, не требуя при этом аннотаций на уровне регионов. Это повышает доверие врачей к решениям ИИ.
  • Кросс-модальный перенос: Зонд, обученный на данных КТ, успешно применялся к данным МРТ с падением AUROC менее чем на 5 пунктов. Это свидетельствует о том, что латентное пространство модели действительно универсально для нейробиологической анатомии, независимо от метода визуализации.

В задачах генерации отчетов и триажа NeuroVFM-LLaVA превзошла передовые базовые модели, такие как GPT-5 и Claude Sonnet 4.5. Модель генерировала отчеты в 24 раза дешевле и выделяла в 23 раза меньше углеродного следа, чем использование GPT-5 напрямую.

📌
Факт. В проспективном исследовании, длившемся одну неделю и охватившем 1155 пациентов, NeuroVFM достигла сбалансированной точности триажа 92.6% против 71.2% у GPT-5. Однако чувствительность составила 86.5%, что означает пропуск 21 из 155 критических находок. Авторы подчеркивают, что система предназначена для поддержки принятия решений, а не для автономного скрининга.

06Как запустить NeuroVFM: Практическое руководство

Исследователи опубликовали код и веса модели, что делает ее доступной для сообщества. Использование стека довольно простое: установка пакета и вызов функций конвейера. Ниже приведен пример кода, использующего официальный API репозитория. Обратите внимание, что для работы требуется FlashAttention-2 (версия v2.6.3), собранная из исходного кода.

NeuroVFM: Революция в нейровизуализации на базе Vol-JEPA
terminalpython
# git clone https://github.com/MLNeurosurg/neurovfm.git && cd neurovfm && pip install -e .
from neurovfm.pipelines import load_encoder, load_diagnostic_head, load_vlm, interpret_findings

encoder, preprocessor = load_encoder("mlinslab/neurovfm-encoder")
dx_head = load_diagnostic_head("mlinslab/neurovfm-dx-ct")
generator, gen_preproc = load_vlm("mlinslab/neurovfm-llm")

# Кодирование исследования, затем предсказание диагнозов
batch = preprocessor.load_study("/path/to/ct/study/", modality="ct")
embeddings = encoder.embed(batch)  # [N_tokens, 768]
predictions = dx_head.predict(embeddings)  # [(label, prob, pred), ...]

# Генерация предварительных выводов, затем опциональный триаж
vols = gen_preproc.load_study("/path/to/ct/study/", modality="ct")
findings = generator.generate(vols, clinical_context="LOC and nausea.")
triage = interpret_findings(findings, "LOC and nausea.", api_key="...")

Код распространяется под лицензией MIT, что позволяет свободное использование в коммерческих и исследовательских целях. Однако веса модели лицензированы по CC-BY-NC-SA-4.0 (Creative Commons Non-Commercial ShareAlike), что означает запрет на коммерческое использование без отдельного соглашения. Кроме того, для доступа к некоторым весам может потребоваться одобрение и использование институциональной электронной почты, что связано с этическими нормами работы с медицинскими данными.

07Сильные стороны и ограничения

Исследование честно описывает как преимущества, так и недостатки NeuroVFM. Понимание этих ограничений критически важно для любого специалиста, рассматривающего внедрение этой технологии.

Сильные стороны

  • Обучается на неструктурированных снимках без необходимости в текстовых отчетах или ручных метках.
  • Делит единое латентное пространство как для КТ, так и для МРТ, что упрощает кросс-модальные задачи.
  • Генерация отчетов значительно дешевле и экологичнее, чем использование крупных языковых моделей общего назначения.
  • Производительность остается стабильной в зависимости от производителя оборудования, силы поля магнита и демографических подгрупп пациентов.

Ограничения

  • Чувствительность триажа на уровне 86.5% означает, что пропуск критических находок в реальной практике остается вероятным сценарием.
  • Лицензия некоммерческая, а модель не имеет одобрения FDA (Управления по санитарному надзору за качеством пищев продуктов и медикаментов США) для клинического использования.
  • Модель подвержена смещениям, связанным с датасетом, архитектурой и целью обучения.
  • Результаты получены в рамках одной академической системы здравоохранения, что может ограничивать обобщаемость на другие популяции и протоколы сканирования.

08Что это значит на практике

Появление NeuroVFM знаменует собой сдвиг парадигмы в медицинском ИИ. Мы переходим от узкоспециализированных моделей, требующих идеальных аннотаций, к фундаментальным моделям, которые учатся на «шуме» реальной клинической жизни. Для разработчиков это означает возможность создания более гибких и дешевых систем поддержки принятия решений. Для клиник — шанс автоматизировать рутинные задачи, такие как сортировка пациентов и черновое описание снимков, высвобождая время радиологов для сложных случаев.

Однако, несмотря на впечатляющие цифры AUROC, NeuroVFM не является «волшебной таблеткой». Пропуск критических находок и отсутствие регуляторного одобрения требуют осторожного подхода. Модель должна рассматриваться как мощный инструмент ассистента, а не замена врача. Тем не менее, открытость кода и данных (в рамках лицензионных ограничений) открывает путь для дальнейших исследований и улучшений, что в перспективе может привести к созданию более безопасных и точных систем диагностики, доступных по всему миру, включая Россию, где локальный запуск таких моделей может стать важным шагом к суверенитету в сфере медицинского ИИ.

Источник: MarkTechPost ↗