Релиз модели21 августа 2026 г., 11:45 МСК🤖 Auto

TIPSv2 от Google DeepMind: прорыв в выравнивании патчей и сегментации

Google DeepMind представила TIPSv2 — новую архитектуру предобучения, которая превосходит более крупные модели в zero-shot сегментации за счет инновационных методов обучения.

Баннер новости 6225

Суть прорыва: когда студент лучше учителя

Исследователи Google DeepMind обнаружили парадоксальное явление: дистилляция знаний позволяет меньшим моделям (ViT-L) превзойти своих более крупных учителей (ViT-g) в способности к выравниванию патчей и текста. Это открытие легло в основу нового рецепта предобучения TIPSv2, который решает проблему «разрыва» между стандартным предобучением и дистилляцией. Ключевым фактором стала подача supervision на видимых токенах.

Три ключевых技术创新

Архитектура TIPSv2 базируется на трех основных улучшениях базовой модели TIPS:

  • iBOT++: Расширение самодистилляционной потери (self-distillation loss) на все патчи, а не только на замаскированные. Это дало прирост +14.1 mIoU в zero-shot сегментации на датасете ADE150.
  • Head-only EMA: Использование экспоненциального скользящего среднего (EMA) только для проекционной головы, а не всей модели. Это снизило количество обучаемых параметров на 42% без потери качества.
  • Multi-Granularity Captions: Использование подписей разного уровня детализации от моделей PaliGemma и Gemini Flash для предотвращения «ленивых» ассоциаций текста с изображением.

Сравнение с конкурентами

TIPSv2 демонстрирует выдающиеся результаты, особенно в задачах, требующих плотного выравнивания (dense alignment). Ниже приведено сравнение с ключевыми моделями на общих бенчмарках.

Метрика / Задача Модель Результат / Примечание
Zero-shot Segmentation (ADE150) TIPSv2 (ViT-g) 17.6 mIoU (против 3.5 у базового TIPS)
Zero-shot Segmentation (SOTA) TIPSv2 Лучший результат среди всех четырех бенчмарков сегментации
Global Image-Text (5 из 7 задач) TIPSv2-g Лучший или второй лучший результат
Сравнение с DINOv3 (ViT-L) TIPSv2 vs DINOv3 TIPSv2 выигрывает 4 из 6 общих задач, несмотря на то, что DINOv3 использует в 6 раз больше параметров учителя и в 15 раз больше изображений
Параметры (Head-only EMA) TIPSv2 Снижение параметров на 42% при сохранении производительности

Визуализация и применение

Анализ PCA-карт признаков показывает, что TIPSv2 генерирует более гладкие и семантически точные карты объектов по сравнению с SigLIP2 и DINOv2. Границы объектов (например, рюкзаки, люди, треккинговые палки) delineated с высокой точностью, что критически важно для задач компьютерного зрения, таких как сегментация, оценка глубины и нормалей.

Доступность

Модель TIPSv2 доступна в виде чекпоинтов и демо на HuggingFace, а также в виде Colab-ноутбука. Исследование опубликовано в рамках подготовки к CVPR 2026. Авторы подчеркивают, что эффективность метода обусловлена не просто увеличением объема данных, а качественным изменением процесса обучения через призму дистилляции.

Источник: Github ↗