Паритет с AR-моделями и ускорение работы
Традиционные медицинские фундаментальные модели почти полностью опираются на авторегрессионную (AR) генерацию, где текст создается слева направо. Авторы исследования представили DiffusionGemma-26B — модель на основе дискретной диффузии, которая генерирует текст путем двунаправленного «очистки» (denoising) токенной канвы. В сравнении с AR-собратьей Gemma-4-26B (того же размера) при использовании идентичного рецепта LoRA-файн-тюнинга, диффузионная модель продемонстрировала следующие результаты:
- Точность: Показала паритет или превосходство над AR-моделью во всех наборах данных медицинского визуального вопросно-ответного поиска (VQA), оцененных с помощью LLM-судьи, устойчивого к verbosity (избыточности).
- Скорость: Скорость декодирования увеличена в 3.5–4.4 раза.
- Эффективность: После дообучения активное количество параметров составляет всего 3.8B, что делает модель конкурентоспособной с передовыми vision-language моделями.
Уникальная функция: Infilling (Заполнение пробелов)
Главное преимущество диффузионного подхода в радиологии — возможность работы в режиме any-order infill. Радиолог может зафиксировать фрагменты отчета (например, начало и конец описания), а модель заполнит текст между ними. Это критически важно, так как реальные отчеты часто бывают краткими, фрагментарными или неконсистентными в зависимости от врача и учреждения. Авторегрессионные модели в такой задаче работают значительно хуже.
Сравнительные характеристики моделей
| Характеристика | DiffusionGemma-26B (Диффузионная) | Gemma-4-26B (Авторегрессионная) |
|---|---|---|
| Архитектура генерации | Двунаправленная очистка (Denoising) | Последовательная (Left-to-Right) |
| Скорость декодирования | 3.5–4.4x быстрее | Базовая скорость |
| Активные параметры (после LoRA) | 3.8B | 26B (полный размер) |
| Интерактивное заполнение (Infilling) | Нативная поддержка | Слабая эффективность |
| Качество ответов (VQA) | Паритет или превышение | Базовый уровень |
Значение для отрасли
Внедрение диффузионных языковых моделей в медицинскую ИИ-инфраструктуру позволяет не только ускорить рутинные задачи, но и изменить интерфейс взаимодействия врача с ИИ. Возможность редактирования и дополнения уже сгенерированного текста делает такие модели более удобными для клинической практики, где важна точность и гибкость формулировок.
Источник: arXiv cs.AI ↗
