От «черного ящика» к отлаживаемому коду
Традиционные модели генерации изображений и видео часто работают как «черные ящики»: пользователь вводит промпт, получает результат и редко может точно объяснить, почему конкретный пиксель или объект выглядит именно так. MaLiang-Harness (MaLiang — «волшебная кисть» в китайской мифологии) предлагает радикально иной подход. Он организует генерацию как непрерывный процесс построения программы, визуального осмотра и исправления ошибок.
Ключевая инновация заключается в том, что исполняемый код, правки и визуальный результат разделяют общую ссылку на ревизию. Это позволяет мультимодальным большим языковым моделям (MLLM) не просто генерировать картинку, а «понимать» структуру сцены, находить несоответствия и вносить точечные изменения, как программист, исправляющий баги в коде.
Архитектура: PEG, TGP и REV
Система опирается на три ключевых компонента, которые обеспечивают прозрачность и контролируемость процесса:
- PEG (Persistent Executable State): Поддерживает постоянное исполняемое состояние. Это означает, что промежуточные шаги генерации сохраняются и могут быть переиспользованы или изменены без потери контекста.
- TGP (Traceable Generation Process): Обеспечивает прослеживаемость процесса генерации. Пользователь видит не только финальный результат, но и логику, по которой модель пришла к нему.
- REV (Revision-aware Editing): Механизм редактирования, aware (осведомленный) о ревизиях. Позволяет вносить правки, опираясь на предыдущие версии и визуальные доказательства.
Демонстрация возможностей
В рамках презентации MaLiang-Harness показаны широкие возможности системы: от сложных сценарных иллюстраций до точечного редактирования фотографий. Модель успешно справляется с задачами, требующими строгого соблюдения композиции и типографики, что ранее было большой проблемой для диффузионных моделей.
| Категория | Примеры задач | Особенности |
|---|---|---|
| Сцены и портреты | Botanical portrait, Character ensemble, Forest characters | Высокая детализация персонажей и объектов, сохранение целостности сцены. |
| Постеры и инфографика | Research infographic, Shanghai city walk, Fashion infographic | Точная верстка, работа с текстом и геометрическими композициями. (Результаты иллюстративные, не бенчмарки). |
| Референсное редактирование | Annotated dining scene, Photographic editing study | Возможность изменения конкретных элементов сцены на основе референсов или аннотаций. |
| 3D и материалы | Ceramic study, A bowl of ramen, Morning still life | Исследование форм, материалов и освещения, генерация фотореалистичных текстур. |
Почему это важно для индустрии
MaLiang-Harness закрывает критический разрыв между программным кодом, который выполняется, и визуальным результатом, который следует за ним. Для исследователей и разработчиков это открывает путь к созданию более надежных систем генеративного И, где результат предсказуем и объясним. Подход «программируемой генерации» позволяет интегрировать И-генерацию в более сложные конвейеры обработки данных, где важна точность, а не только креативность.
Доступность и цитирование
Работа опубликована в arXiv под идентификатором 2609.34309. Авторы: Haoyu Zhao, Zihao Zhang, Xudong Wang, Jiaxi Gu, Zuxuan Wu, Yu-Gang Jiang, Shuicheng Yan. Исследователи призывают использовать этот фреймворк в научных работах с обязательным цитированием их статьи «MaLiang-Harness: A Programmable Path to Image and Video Generation».
Источник: Github ↗
