Инструменты3 июля 2026 г., 11:45 МСК🤖 Auto

ShutterMuse: MLLM для фотосъемки в реальном времени с точностью до ключевых точек

Исследователи представили ShutterMuse — мультимодальную модель, которая помогает фотографу кадрировать снимок, а модели — корректировать позу субъекта прямо во время съемки.

Баннер новости 2836

Проблема: разрыв между кадрированием и позированием

Современные benchmarks для эстетического кадрирования (crop prediction) оценивают только пост-обработку изображений, игнорируя рекомендации по позе субъекта. Это оставляет без внимания возможности мультимодальных больших языковых моделей (MLLM) в качестве интерактивных ассистентов во время захвата изображения. Авторы работы заполняют этот пробел, вводя два новых направления: принятие решений о композиции со стороны фотографа и рекомендация позы с учетом сцены со стороны субъекта.

Решение: ShutterMuse и CaptureGuide

Для решения задачи представлена модель ShutterMuse, обученная с использованием контролируемого обучения (SFT) и reinforcement fine-tuning. В основе лежит датасет CaptureGuide-Dataset, содержащий 130 000 образцов с текстовыми обоснованиями и структурированными визуальными аннотациями. Оценка проводится через CaptureGuide-Bench, который измеряет качество как композиционных решений, так и рекомендаций по позе.

Сравнение с состоянием искусства (SOTA)

Эксперименты показывают, что общие MLLMs способны принимать решения о композиции, но не могут точно локализовать зоны кадрирования. Специализированные модели кадрирования, напротив, хорошо локализуют кроп, но ограничены только этой задачей. ShutterMuse объединяет эти возможности, демонстрируя SOTA результаты в guidance для фотографа и конкурентоспособные результаты в рекомендации позы, при этом требуя значительно меньших вычислительных ресурсов.

Характеристика Общие MLLMs Специализированные модели кадрирования ShutterMuse (предлагаемая)
Принятие решений о композиции Да Нет Да (SOTA)
Точная локализация кропа Нет Да Да
Рекомендация позы субъекта Нет (нет структурированных данных) Нет Да (конкурентоспособно)
Стоимость инференса Высокая Средняя Значительно ниже

Техническая реализация и результаты

Модель генерирует скелеты ключевых точек (keypoint skeletons), которые затем используются для рендеринга изображений с правильной позой (например, через GPT-Image-2). Это позволяет не просто рекомендовать текст, а визуализировать желаемый результат. Работа демонстрирует потенциал MLLM как полноценного ассистента, способного направлять процесс съемки в реальном времени, а не только анализировать готовые кадры.

Источник: Github ↗