Исследования7 сентября 2026 г., 20:18 МСК🤖 Auto

MedProb: Простой метод пробития VLM превзошел медицинские LLM

Исследование MedProb доказывает, что для Med-VQA не нужны сложные пайплайны: линейный анализ скрытых состояний замороженных VLM работает лучше генерации.

Баннер новости 6956

Разрушение мифа о необходимости дообучения

Традиционно считается, что для решения медицинских задач визуального вопрос-ответing (Med-VQA) требуются либо масштабное дообучение (fine-tuning) больших моделей, либо сложные многоагентные системы. Авторы работы MedProb (Erfan Nourbakhsh, Ke Yang, Anthony Rios) опровергают это, представив легковесный фреймворк, который извлекает ответ из замороженных (frozen) представлений VLM без этапа генерации свободного текста. Метод использует линейное пробитие (probing) для предсказания ответов в формате множественного выбора.

Результаты на ключевых бенчмарках

MedProb демонстрирует выдающиеся результаты на трех основных наборах данных: PATH-VQA, SLAKE и VQA-RAD. Фреймворк не только превосходит стандартные методы промптинга, но и показывает результаты, сопоставимые или лучшие, чем специализированные медицинские VLM и агентные системы. Это указывает на то, что значительная часть медицинской информации уже заложена в базовые представления моделей.

Скрытый потенциал малых моделей

Один из самых интригующих выводов исследования касается разрыва между моделями разного размера. При использовании генерации текста (prompting) большие модели значительно превосходят маленькие. Однако MedProb существенно сокращает этот разрыв. Это означает, что даже малые VLM содержат больше «восстанавливаемой» медицинской информации, чем это видно при оценке через генерацию. Линейный декодер способен извлечь сигнал, который генеративные модели часто «теряют» или искажают.

Проблема позиционной предвзятости

Исследователи также выявили критический недостаток генеративных подходов: answer-position bias (предвзятость к позиции ответа). При генерации свободного текста модели склонны выбирать ответы, стоящие в начале или конце списка, с отклонением до 10 процентных пунктов. MedProb, хотя и подвержен влиянию позиции, демонстрирует иной паттерн смещения, что делает его более надежным инструментом для объективной оценки знаний модели.

Отсутствие явного преимущества мед-адаптации

Анализ 14 пар общих и медицинских VLM показал парадоксальный факт: медицинская адаптация (fine-tuning на медицинских данных) не гарантирует улучшения линейной декодируемости. Это ставит под вопрос эффективность текущих подходов к дообучению, если цель — именно извлечение структурированных знаний, а не имитация диалога.

Метрика / Аспект Генерация (Prompting) MedProb (Probing)
Требования к модели Часто требует дообучения Работает на замороженных весах
Сравнение Small vs Large Большой разрыв в качестве Разрыв существенно меньше
Answer-position bias До 10 п.п. (сильная предвзятость) Присутствует, но иной характер
Влияние Med-адаптации Считается обязательным Не всегда улучшает декодируемость

Авторы отмечают, что метод может быть расширен на задачи с открытым ответом (open-ended generation) с использованием процедуры скоринга через отсев (rejection-sampling), что открывает новые пути для оптимизации вычислительных ресурсов в медицине.

Источник: arXiv cs.CL ↗