Исследования2 июля 2026 г., 09:20 МСК🤖 Auto

SPIRE: AI-агенты учатся дизайну через «очистку» шума

Исследователи из Microsoft и Университета Мичигана представили SPIRE — фреймворк, который решает проблему персонализации слайдов, обучая агентов восстанавливать чистый дизайн из намеренно испорченных структур.

Баннер новости 2783

Проблема: «Слепое» копирование шаблонов

Современные AI-агенты для создания презентаций часто ограничиваются использованием заранее заданных шаблонов или интерпретацией длинных текстовых инструкций. Это приводит к потере тонких дизайнерских намерений (latent design intents) и невозможности качественной персонализации на уровне отдельных страниц (Page-level Slide Personalization, PSP). Система не понимает, почему дизайнер выбрал именно такую композицию, а лишь копирует структуру.

Решение: Персонализация как обратное планирование

Авторы предлагают рассматривать дизайн как задачу обратного планирования (inverse planning). Вместо того чтобы пытаться сгенерировать слайд с нуля, система SPIRE (Structural Personalization via Inverse Reinforcement learning) обучается восстанавливать исходный дизайн из «зашумленной» версии. Ключевая особенность — метод не зависит от конкретного инструмента (PowerPoint, Beamer), а учится абстрактным намерениям дизайнера.

Механика: Структурное денуазинг и RL

Процесс обучения строится на двух агентах, взаимодействующих через подкрепление (Reinforcement Learning, RL):

  • Коррупция: Чистая структура слайда намеренно искажается (удаляются элементы, меняются связи).
  • Денуазинг: Агенты учатся восстанавливать исходную структуру, минимизируя ошибку.
  • Теоретическое обоснование: Авторы доказали, что структурное восстановление является согласованным суррогатом для PSP, а многоагентная форма строго снижает дисперсию градиента политики в RL.

Результаты и значимость

Эксперименты демонстрируют превосходство SPIRE над существующими методами в задачах тонкой настройки макетов. Подход позволяет создавать персонализированные презентации, сохраняя эстетическую целостность, без необходимости жесткого контроля над инструментами генерации. Работа принята к публикации в ECCV 2026.

Аспект Традиционные AI-агенты SPIRE (предлагаемый метод)
Основа генерации Шаблоны / Текстовые промпты Восстановление латентных намерений
Уровень контроля Глобальный (весь стек) Структурный (на уровне страниц)
Зависимость от ПО Высокая (привязка к API) Инвариантность к инструменту
Метод обучения Supervised / Prompt-tuning Reinforcement Learning (Multi-agent)

Источник: arXiv cs.AI ↗