Главная/Блог/Обзор/NV-Reason-CT: 3D VLM для анализа КТ с…
Обзор3 мин чтения · 24 сентября 2026 г.

NV-Reason-CT: 3D VLM для анализа КТ с цепочкой рассуждений

NVIDIA представила NV-Reason-CT — первую открытую модель VLM для 3D-КТ, использующую Qwen3.5-4B и 3D-ViT для генерации радиологических отчетов с объяснением логики.

NV-Reason-CT: 3D VLM для анализа КТ с цепочкой рассуждений

Анализ 3D-компьютерной томографии (КТ) остается «святым граалем» для медицинских ИИ-моделей. В отличие от 2D-снимков, КТ-снимки содержат объемные данные, где пространственные связи между срезами критически важны для диагностики. NVIDIA представила NV-Reason-CT — открытую модель Vision-Language Model (VLM), специально разработанную для работы с объемными данными. Модель сочетает 3D-визуальный энкодер и языковую модель Qwen3.5-4B, генерируя не просто диагноз, а развернутую цепочку рассуждений (Chain-of-Thought), имитирующую мышление радиолога.

01Архитектура: почему 2D не работает для 3D

Стандартные VLM обрабатывают изображения как сетку 2D-токенов. При попытке применить их к КТ, объем часто «сплющивают» в последовательность срезов, теряя информацию о глубине. NV-Reason-CT решает эту проблему нативно:

  • 3D Vision Transformer (ViT): Используется архитектура, способная обрабатывать объемные данные с высоким изотропным разрешением, сохраняя пространственную структуру.
  • Токенизация: Применяются неперекрывающиеся патчи, формирующие плотную сетку визуальных токенов на один снимок, что обеспечивает детальное представление объема.
  • 3D MRoPE: Языковая модель получает не только визуальные токены, но и их 3D-координаты. Это позволяет LLM учитывать пространственные отношения между токенами на всех слоях трансформера.
💡
Важно для практиков. Большое количество визуальных токенов передается в LLM без существенного сжатия. Это требует значительных ресурсов VRAM, но сохраняет пространственную целостность, необходимую для выявления объемных патологий (опухоли, плевральный выпот).

02Языковая модель и метод обучения

В качестве языкового ядра используется Qwen3.5-4B. Обучение проходит в два этапа:

  1. Supervised Fine-Tuning (SFT): Модель обучается на обширном наборе данных, включающем структурированные отчеты, аннотации рассуждений радиологов и VQA (вопросы-ответы). Данные включают наборы CT-RATE, NIH CT и CancerVerse, а также синтетические данные, дистиллированные из больших LLM.
  2. Reinforcement Learning (RL): Дообучение для улучшения качества рассуждений и соответствия клиническим стандартам.

Модель не просто классифицирует аномалии, а генерирует отчеты, описывая систематический обзор анатомических зон, дифференциальные диагнозы и степень уверенности. Это делает выводы аудируемыми и доверительными.

03Производительность и бенчмарки

Модель демонстрирует state-of-the-art результаты на бенчмарке CT-RATE, превосходя как 3D-контрастные модели, так и гибридные 2D/3D подходы.

Метрика NV-Reason-CT Примечание
Macro-F1 0.614 Лучший результат среди открытых 3D-моделей
Macro-AUROC 0.871 Высокая способность различать классы

Модель обучена распознавать множество аномалий в грудной клетке и брюшной полости, включая легочные узлы, пневмоторакс, поражения печени и кисты почек.

⚠️
Юридический аспект. NV-Reason-CT — это open research foundation, а не сертифицированное медицинское устройство. Она предназначена для разработчиков и исследователей для пост-обучения (post-training) под конкретные задачи, а не для автономной диагностики пациентов.

04Практическое применение и интеграция

Модель поддерживает многошаговый диалог. Радиологи или разработчики могут задавать уточняющие вопросы по конкретным находкам, запрашивать пересмотр дифференциальных диагнозов или исследовать логику модели на любом этапе анализа.

Для локального развертывания и дообучения (fine-tuning) рекомендуется использовать инфраструктуру NVIDIA, совместимую с экосистемой Medical AI. Модель интегрируется с другими инструментами NVIDIA для сегментации и генерации синтетических данных.

Пример конфигурации для загрузки (концептуально)

Для работы с моделью потребуется загрузить веса Qwen3.5-4B и 3D-ViT энкодера. Ниже приведен пример команды для инициализации модели в среде, поддерживающей Hugging Face Transformers (требует адаптации под конкретный фреймворк NVIDIA):

terminalpython
from transformers import AutoModelForCausalLM, AutoTokenizer

# Загрузка языковой модели Qwen3.5-4B
model_name = "Qwen/Qwen3.5-4B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, device_map="auto")

# Инициализация 3D ViT энкодера (требуется специфичный для NVIDIA код)
# from nv_reason_ct import NVReasonCT
# ct_model = NVReasonCT.load_from_checkpoint("path_to_nv_reason_ct_weights")

05Кому подойдёт / что запустится

  • Исследователи MedAI: Для создания специализированных решений на базе обширных наборов радиологических рассуждений.
  • Разработчики PACS/RIS систем: Для интеграции модуля «второго мнения» с объяснимой логикой (Chain-of-Thought).
  • Железо: Из-за большого количества визуальных токенов и модели Qwen3.5-4B, для комфортного инференса и дообучения потребуются GPU с большим объемом VRAM (рекомендуется NVIDIA H100/A100 или несколько RTX 4090/3090 с NVLink). Запуск на потребительских картах с 24 ГБ VRAM возможен только с агрессивным квантованием (QLoRA) и ограничением контекста.

Источник: NVIDIA Developer ↗