Суть прорыва: когда студент лучше учителя
Исследователи Google DeepMind обнаружили парадоксальное явление: дистилляция знаний позволяет меньшим моделям (ViT-L) превзойти своих более крупных учителей (ViT-g) в способности к выравниванию патчей и текста. Это открытие легло в основу нового рецепта предобучения TIPSv2, который решает проблему «разрыва» между стандартным предобучением и дистилляцией. Ключевым фактором стала подача supervision на видимых токенах.
Три ключевых技术创新
Архитектура TIPSv2 базируется на трех основных улучшениях базовой модели TIPS:
- iBOT++: Расширение самодистилляционной потери (self-distillation loss) на все патчи, а не только на замаскированные. Это дало прирост +14.1 mIoU в zero-shot сегментации на датасете ADE150.
- Head-only EMA: Использование экспоненциального скользящего среднего (EMA) только для проекционной головы, а не всей модели. Это снизило количество обучаемых параметров на 42% без потери качества.
- Multi-Granularity Captions: Использование подписей разного уровня детализации от моделей PaliGemma и Gemini Flash для предотвращения «ленивых» ассоциаций текста с изображением.
Сравнение с конкурентами
TIPSv2 демонстрирует выдающиеся результаты, особенно в задачах, требующих плотного выравнивания (dense alignment). Ниже приведено сравнение с ключевыми моделями на общих бенчмарках.
| Метрика / Задача | Модель | Результат / Примечание |
|---|---|---|
| Zero-shot Segmentation (ADE150) | TIPSv2 (ViT-g) | 17.6 mIoU (против 3.5 у базового TIPS) |
| Zero-shot Segmentation (SOTA) | TIPSv2 | Лучший результат среди всех четырех бенчмарков сегментации |
| Global Image-Text (5 из 7 задач) | TIPSv2-g | Лучший или второй лучший результат |
| Сравнение с DINOv3 (ViT-L) | TIPSv2 vs DINOv3 | TIPSv2 выигрывает 4 из 6 общих задач, несмотря на то, что DINOv3 использует в 6 раз больше параметров учителя и в 15 раз больше изображений |
| Параметры (Head-only EMA) | TIPSv2 | Снижение параметров на 42% при сохранении производительности |
Визуализация и применение
Анализ PCA-карт признаков показывает, что TIPSv2 генерирует более гладкие и семантически точные карты объектов по сравнению с SigLIP2 и DINOv2. Границы объектов (например, рюкзаки, люди, треккинговые палки) delineated с высокой точностью, что критически важно для задач компьютерного зрения, таких как сегментация, оценка глубины и нормалей.
Доступность
Модель TIPSv2 доступна в виде чекпоинтов и демо на HuggingFace, а также в виде Colab-ноутбука. Исследование опубликовано в рамках подготовки к CVPR 2026. Авторы подчеркивают, что эффективность метода обусловлена не просто увеличением объема данных, а качественным изменением процесса обучения через призму дистилляции.
Источник: Github ↗
