Исследования3 июля 2026 г., 12:19 МСК🤖 Auto

Диффузионные LLM для радиологии: скорость x4 и интерактивный черновик

Исследователи адаптировали модель DiffusionGemma-26B для генерации радиологических отчетов, показав ускорение декодирования в 4 раза и уникальную функцию заполнения пробелов, недоступную авторегрессионным моделям.

Баннер новости 2839

Паритет с AR-моделями и ускорение работы

Традиционные медицинские фундаментальные модели почти полностью опираются на авторегрессионную (AR) генерацию, где текст создается слева направо. Авторы исследования представили DiffusionGemma-26B — модель на основе дискретной диффузии, которая генерирует текст путем двунаправленного «очистки» (denoising) токенной канвы. В сравнении с AR-собратьей Gemma-4-26B (того же размера) при использовании идентичного рецепта LoRA-файн-тюнинга, диффузионная модель продемонстрировала следующие результаты:

  • Точность: Показала паритет или превосходство над AR-моделью во всех наборах данных медицинского визуального вопросно-ответного поиска (VQA), оцененных с помощью LLM-судьи, устойчивого к verbosity (избыточности).
  • Скорость: Скорость декодирования увеличена в 3.5–4.4 раза.
  • Эффективность: После дообучения активное количество параметров составляет всего 3.8B, что делает модель конкурентоспособной с передовыми vision-language моделями.

Уникальная функция: Infilling (Заполнение пробелов)

Главное преимущество диффузионного подхода в радиологии — возможность работы в режиме any-order infill. Радиолог может зафиксировать фрагменты отчета (например, начало и конец описания), а модель заполнит текст между ними. Это критически важно, так как реальные отчеты часто бывают краткими, фрагментарными или неконсистентными в зависимости от врача и учреждения. Авторегрессионные модели в такой задаче работают значительно хуже.

Сравнительные характеристики моделей

Характеристика DiffusionGemma-26B (Диффузионная) Gemma-4-26B (Авторегрессионная)
Архитектура генерации Двунаправленная очистка (Denoising) Последовательная (Left-to-Right)
Скорость декодирования 3.5–4.4x быстрее Базовая скорость
Активные параметры (после LoRA) 3.8B 26B (полный размер)
Интерактивное заполнение (Infilling) Нативная поддержка Слабая эффективность
Качество ответов (VQA) Паритет или превышение Базовый уровень

Значение для отрасли

Внедрение диффузионных языковых моделей в медицинскую ИИ-инфраструктуру позволяет не только ускорить рутинные задачи, но и изменить интерфейс взаимодействия врача с ИИ. Возможность редактирования и дополнения уже сгенерированного текста делает такие модели более удобными для клинической практики, где важна точность и гибкость формулировок.

Источник: arXiv cs.AI ↗