Инструменты6 июля 2026 г., 13:46 МСК🤖 Auto

PhotoQuilt: Генерация фотомозаик 14K без дообучения моделей

Исследователи из Университета Торонто и Samsung представили PhotoQuilt — метод создания сверхвысоких фотомозаик (до 14 336 px) без дообучения диффузионных моделей.

Баннер новости 2951

Проблема масштаба в генеративном ИИ

Создание фотомозаик (photomosaics) — изображений, где локальные фрагменты являются независимыми тайлами, а в целом формируют единую сцену — сталкивается с фундаментальной проблемой. Прямая генерация в высоком разрешении требует огромных вычислительных ресурсов и часто приводит к «размытию» деталей, превращая мозаику в одно гладкое изображение. Методы на основе патчей сохраняют локальную детализацию, но теряют глобальную структуру композиции.

Решение: PhotoQuilt

Команда разработчиков, включающая исследователей из University of Toronto, Vector Institute и Samsung Research, представила PhotoQuilt — framework, не требующий дообучения (training-free). Алгоритм использует процедуру «загруженной» дешифровки (bootstrapped tiled denoising):

  • Шаг 1: Генерация глобальной композиции в низком разрешении для фиксации структуры.
  • Шаг 2: Апскейлинг в латентном пространстве и повторное добавление шума для восстановления генеративного потенциала.
  • Шаг 3: Дешифровка внутри фиксированных тайлов. Каждый тайл генерируется независимо, но подчиняется общей композиции.

Такой подход позволяет избежать квадратичной стоимости внимания (attention cost) при работе с большими холстами.

Результаты и метрики

PhotoQuilt демонстрирует превосходство над существующими базовыми моделями как в сохранении глобальной структуры, так и в локальной реалистичности тайлов. Ниже приведены примеры генерации:

Параметр Значение / Описание
Максимальное разрешение 14 336 × 14 336 пикселей
Размер тайла 256 × 256 пикселей
Пример 1 (Пейзаж) Панорама Торонто. Каждый тайл сгенерирован по промпту «A bird» (Птица), но вместе они формируют четкий силуэт города.
Пример 2 (Портрет) Льюис Хэмилтон (12 288 × 6 144 px). Глобальная структура основана на фото победы на Гран-при Испании 2026, каждый тайл — реальное фото с подиума.
Требования к обучению Training-free (не требует дообучения базовой модели)

Значение для индустрии

Работа, опубликованная в arXiv (eprint: 2606.30968), открывает путь к созданию гиперреалистичных коллажей и арт-объектов огромного размера без необходимости использования специализированных кластеров для прямой генерации. Метод позволяет масштабировать canvas до произвольных размеров, сохраняя при этом семантическую целостность изображения.

Источник: Github ↗