Проблема «застывших» токенизаторов
Традиционные модели генерации изображений, такие как Stable Diffusion, опираются на VQGAN (Vector-Quantized Generative Adversarial Network). Ключевая проблема заключается в том, что токенизатор (кодировщик) оптимизируется исключительно для задачи реконструкции изображения, а не для того, чтобы сгенерированные им токены были легко предсказуемы для следующей модели (LLM или Diffusion). Это создает «рассогласование целей» (mismatch), которое ограничивает качество и детализацию финального изображения.
Что такое GEAR?
GEAR (Guided End-to-End AutoRegression) — это новый подход, который объединяет процесс кодирования и генерации в единую сквозную (end-to-end) систему. Вместо того чтобы фиксировать токенизатор на этапе предобучения, GEAR обучает его совместно с генератором, учитывая будущую задачу предсказания следующего токена. Это позволяет модели «понимать», какие визуальные паттерны наиболее важны для последующей генерации, а не просто для точного восстановления пикселей.
Ключевые технические детали
Метод GEAR внедряет механизм направленного обучения (guided learning), который корректирует пространство латентных представлений. Основные преимущества включают:
- Устранение рассогласования: Токенизатор теперь оптимизируется под предсказуемость, а не только под реконструкцию.
- Повышение детализации: Модель лучше справляется с мелкими текстурами и сложными структурами, так как токены несут больше семантической информации для следующего шага.
- Эффективность: Сохраняется скорость автогенерации, характерная для autoregressive моделей, но с качеством, близким к диффузионным.
Почему это важно?
Решение проблемы frozen tokenizer mismatch открывает путь к созданию более эффективных и качественных генеративных моделей. GEAR демонстрирует, что совместное обучение компонентов системы дает значительный прирост метрик качества (FID, IS) по сравнению с базовыми VQGAN-подходами. Это важный шаг к созданию универсальных мультимодальных моделей, где визуальное представление тесно связано с языковым или последовательным прогнозированием.
Источник: Github ↗
