Анализ 3D-компьютерной томографии (КТ) остается «святым граалем» для медицинских ИИ-моделей. В отличие от 2D-снимков, КТ-снимки содержат объемные данные, где пространственные связи между срезами критически важны для диагностики. NVIDIA представила NV-Reason-CT — открытую модель Vision-Language Model (VLM), специально разработанную для работы с объемными данными. Модель сочетает 3D-визуальный энкодер и языковую модель Qwen3.5-4B, генерируя не просто диагноз, а развернутую цепочку рассуждений (Chain-of-Thought), имитирующую мышление радиолога.
01Архитектура: почему 2D не работает для 3D
Стандартные VLM обрабатывают изображения как сетку 2D-токенов. При попытке применить их к КТ, объем часто «сплющивают» в последовательность срезов, теряя информацию о глубине. NV-Reason-CT решает эту проблему нативно:
- 3D Vision Transformer (ViT): Используется архитектура, способная обрабатывать объемные данные с высоким изотропным разрешением, сохраняя пространственную структуру.
- Токенизация: Применяются неперекрывающиеся патчи, формирующие плотную сетку визуальных токенов на один снимок, что обеспечивает детальное представление объема.
- 3D MRoPE: Языковая модель получает не только визуальные токены, но и их 3D-координаты. Это позволяет LLM учитывать пространственные отношения между токенами на всех слоях трансформера.
02Языковая модель и метод обучения
В качестве языкового ядра используется Qwen3.5-4B. Обучение проходит в два этапа:
- Supervised Fine-Tuning (SFT): Модель обучается на обширном наборе данных, включающем структурированные отчеты, аннотации рассуждений радиологов и VQA (вопросы-ответы). Данные включают наборы CT-RATE, NIH CT и CancerVerse, а также синтетические данные, дистиллированные из больших LLM.
- Reinforcement Learning (RL): Дообучение для улучшения качества рассуждений и соответствия клиническим стандартам.
Модель не просто классифицирует аномалии, а генерирует отчеты, описывая систематический обзор анатомических зон, дифференциальные диагнозы и степень уверенности. Это делает выводы аудируемыми и доверительными.
03Производительность и бенчмарки
Модель демонстрирует state-of-the-art результаты на бенчмарке CT-RATE, превосходя как 3D-контрастные модели, так и гибридные 2D/3D подходы.
| Метрика | NV-Reason-CT | Примечание |
|---|---|---|
| Macro-F1 | 0.614 | Лучший результат среди открытых 3D-моделей |
| Macro-AUROC | 0.871 | Высокая способность различать классы |
Модель обучена распознавать множество аномалий в грудной клетке и брюшной полости, включая легочные узлы, пневмоторакс, поражения печени и кисты почек.
04Практическое применение и интеграция
Модель поддерживает многошаговый диалог. Радиологи или разработчики могут задавать уточняющие вопросы по конкретным находкам, запрашивать пересмотр дифференциальных диагнозов или исследовать логику модели на любом этапе анализа.
Для локального развертывания и дообучения (fine-tuning) рекомендуется использовать инфраструктуру NVIDIA, совместимую с экосистемой Medical AI. Модель интегрируется с другими инструментами NVIDIA для сегментации и генерации синтетических данных.
Пример конфигурации для загрузки (концептуально)
Для работы с моделью потребуется загрузить веса Qwen3.5-4B и 3D-ViT энкодера. Ниже приведен пример команды для инициализации модели в среде, поддерживающей Hugging Face Transformers (требует адаптации под конкретный фреймворк NVIDIA):
from transformers import AutoModelForCausalLM, AutoTokenizer
# Загрузка языковой модели Qwen3.5-4B
model_name = "Qwen/Qwen3.5-4B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, device_map="auto")
# Инициализация 3D ViT энкодера (требуется специфичный для NVIDIA код)
# from nv_reason_ct import NVReasonCT
# ct_model = NVReasonCT.load_from_checkpoint("path_to_nv_reason_ct_weights")05Кому подойдёт / что запустится
- Исследователи MedAI: Для создания специализированных решений на базе обширных наборов радиологических рассуждений.
- Разработчики PACS/RIS систем: Для интеграции модуля «второго мнения» с объяснимой логикой (Chain-of-Thought).
- Железо: Из-за большого количества визуальных токенов и модели Qwen3.5-4B, для комфортного инференса и дообучения потребуются GPU с большим объемом VRAM (рекомендуется NVIDIA H100/A100 или несколько RTX 4090/3090 с NVLink). Запуск на потребительских картах с 24 ГБ VRAM возможен только с агрессивным квантованием (QLoRA) и ограничением контекста.
Источник: NVIDIA Developer ↗
