Проблема масштаба в генеративном ИИ
Создание фотомозаик (photomosaics) — изображений, где локальные фрагменты являются независимыми тайлами, а в целом формируют единую сцену — сталкивается с фундаментальной проблемой. Прямая генерация в высоком разрешении требует огромных вычислительных ресурсов и часто приводит к «размытию» деталей, превращая мозаику в одно гладкое изображение. Методы на основе патчей сохраняют локальную детализацию, но теряют глобальную структуру композиции.
Решение: PhotoQuilt
Команда разработчиков, включающая исследователей из University of Toronto, Vector Institute и Samsung Research, представила PhotoQuilt — framework, не требующий дообучения (training-free). Алгоритм использует процедуру «загруженной» дешифровки (bootstrapped tiled denoising):
- Шаг 1: Генерация глобальной композиции в низком разрешении для фиксации структуры.
- Шаг 2: Апскейлинг в латентном пространстве и повторное добавление шума для восстановления генеративного потенциала.
- Шаг 3: Дешифровка внутри фиксированных тайлов. Каждый тайл генерируется независимо, но подчиняется общей композиции.
Такой подход позволяет избежать квадратичной стоимости внимания (attention cost) при работе с большими холстами.
Результаты и метрики
PhotoQuilt демонстрирует превосходство над существующими базовыми моделями как в сохранении глобальной структуры, так и в локальной реалистичности тайлов. Ниже приведены примеры генерации:
| Параметр | Значение / Описание |
|---|---|
| Максимальное разрешение | 14 336 × 14 336 пикселей |
| Размер тайла | 256 × 256 пикселей |
| Пример 1 (Пейзаж) | Панорама Торонто. Каждый тайл сгенерирован по промпту «A bird» (Птица), но вместе они формируют четкий силуэт города. |
| Пример 2 (Портрет) | Льюис Хэмилтон (12 288 × 6 144 px). Глобальная структура основана на фото победы на Гран-при Испании 2026, каждый тайл — реальное фото с подиума. |
| Требования к обучению | Training-free (не требует дообучения базовой модели) |
Значение для индустрии
Работа, опубликованная в arXiv (eprint: 2606.30968), открывает путь к созданию гиперреалистичных коллажей и арт-объектов огромного размера без необходимости использования специализированных кластеров для прямой генерации. Метод позволяет масштабировать canvas до произвольных размеров, сохраняя при этом семантическую целостность изображения.
Источник: Github ↗
