Инструменты1 октября 2026 г., 13:46 МСК🤖 Auto

MaLiang-Harness: Программируемая генерация видео и изображений

Новый фреймворк MaLiang-Harness от исследователей из Alibaba и других институтов превращает генерацию медиа в отлаживаемый процесс с использованием MLLM, обеспечивая точный контроль через итеративное редактирование.

Баннер новости 8687

От «черного ящика» к отлаживаемому коду

Традиционные модели генерации изображений и видео часто работают как «черные ящики»: пользователь вводит промпт, получает результат и редко может точно объяснить, почему конкретный пиксель или объект выглядит именно так. MaLiang-Harness (MaLiang — «волшебная кисть» в китайской мифологии) предлагает радикально иной подход. Он организует генерацию как непрерывный процесс построения программы, визуального осмотра и исправления ошибок.

Ключевая инновация заключается в том, что исполняемый код, правки и визуальный результат разделяют общую ссылку на ревизию. Это позволяет мультимодальным большим языковым моделям (MLLM) не просто генерировать картинку, а «понимать» структуру сцены, находить несоответствия и вносить точечные изменения, как программист, исправляющий баги в коде.

Архитектура: PEG, TGP и REV

Система опирается на три ключевых компонента, которые обеспечивают прозрачность и контролируемость процесса:

  • PEG (Persistent Executable State): Поддерживает постоянное исполняемое состояние. Это означает, что промежуточные шаги генерации сохраняются и могут быть переиспользованы или изменены без потери контекста.
  • TGP (Traceable Generation Process): Обеспечивает прослеживаемость процесса генерации. Пользователь видит не только финальный результат, но и логику, по которой модель пришла к нему.
  • REV (Revision-aware Editing): Механизм редактирования, aware (осведомленный) о ревизиях. Позволяет вносить правки, опираясь на предыдущие версии и визуальные доказательства.

Демонстрация возможностей

В рамках презентации MaLiang-Harness показаны широкие возможности системы: от сложных сценарных иллюстраций до точечного редактирования фотографий. Модель успешно справляется с задачами, требующими строгого соблюдения композиции и типографики, что ранее было большой проблемой для диффузионных моделей.

Категория Примеры задач Особенности
Сцены и портреты Botanical portrait, Character ensemble, Forest characters Высокая детализация персонажей и объектов, сохранение целостности сцены.
Постеры и инфографика Research infographic, Shanghai city walk, Fashion infographic Точная верстка, работа с текстом и геометрическими композициями. (Результаты иллюстративные, не бенчмарки).
Референсное редактирование Annotated dining scene, Photographic editing study Возможность изменения конкретных элементов сцены на основе референсов или аннотаций.
3D и материалы Ceramic study, A bowl of ramen, Morning still life Исследование форм, материалов и освещения, генерация фотореалистичных текстур.

Почему это важно для индустрии

MaLiang-Harness закрывает критический разрыв между программным кодом, который выполняется, и визуальным результатом, который следует за ним. Для исследователей и разработчиков это открывает путь к созданию более надежных систем генеративного И, где результат предсказуем и объясним. Подход «программируемой генерации» позволяет интегрировать И-генерацию в более сложные конвейеры обработки данных, где важна точность, а не только креативность.

Доступность и цитирование

Работа опубликована в arXiv под идентификатором 2609.34309. Авторы: Haoyu Zhao, Zihao Zhang, Xudong Wang, Jiaxi Gu, Zuxuan Wu, Yu-Gang Jiang, Shuicheng Yan. Исследователи призывают использовать этот фреймворк в научных работах с обязательным цитированием их статьи «MaLiang-Harness: A Programmable Path to Image and Video Generation».

Источник: Github ↗