Релиз модели15 июля 2026 г., 17:45 МСК🤖 Auto

Яндекс представил Alice AI ART 2.0: единая модель для генерации и редактирования

Команда Яндекса выпустила Alice AI ART 2.0 — первую unified-модель, объединяющую задачи Text-to-Image и Image-to-Image. Это решение устраняет необходимость поддержки двух разных стеков и повышает качество генерации текста и редактирования изображений

Баннер новости 3637

От разрозненных стеков к единому фундаменту

Предыдущее поколение Alice AI ART 1.0 опиралось на классический диффузионный свёрточный генератор для создания изображений (T2I) и отдельный пайплайн для редактирования (I2I). Такая архитектура создавала значительные операционные издержки: улучшения приходилось внедрять дважды, данные готовились раздельно, а метрики качества было сложно сравнивать. Команда Яндекса провела полгода экспериментов, чтобы создать единую модель (unified), которая одинаково эффективно решает обе задачи, перенимая визуальные и текстовые приоритеты друг у друга.

Методология оценки: «Корзины» и «Слайсы»

Яндекс отказался от стандартных академических бенчмарков, которые легко «взломать» и которые плохо коррелируют с реальным пользовательским опытом. Вместо этого разработчики сформировали специализированные наборы данных на основе реальных запросов из Алисы и Шедеврума. Оценка качества строится на трёх уровнях выборки:

  • Validation: рабочая корзина для ежедневных экспериментов.
  • Test: hold-out выборка для проверки на переобучение (используется раз в несколько недель).
  • Deploy: финальная оценка предрелизных моделей.

Важно отметить, что для задач редактирования (I2I) используется выборка в 1000 примеров (против 500 для T2I), так как сценарии редактирования требуют более широкого покрытия. Для критически важных категорий, таких как работа с текстом на изображении (леттеринг) и стилизация, выделены отдельные «слайсы» с оверсэмплингом.

Техническая синергия задач

Объединение задач позволило модели извлекать выгоду из обеих дисциплин. Задача I2I (Image-to-Image) заставляет модель точно кодировать визуальное содержимое референса — форму, текстуру и пространственные отношения. Навык «чтения картинки» напрямую улучшает общее визуальное восприятие. В свою очередь, данные T2I (Text-to-Image) содержат более богатые и детальные описания (освещение, стиль, композиция), что углубляет понимание языка и релевантности запроса.

Ключевые метрики и фокус качества

Система метрик разделена по типам задач. Для T2I главным сигналом является предпочтительность результата пользователем и точность следования запросу, с особым вниманием к качеству отрисовки текста. Для I2I критически важно не только качество изменений, но и сохранение исходных черт изображения при низкой дефектности изменённых регионов. Общий результат в I2I считается плохим, если хотя бы один из критериев (релевантность, сохранение, дефектность) не проходит порог.

Параметр Text-to-Image (T2I) Image-to-Image (I2I)
Размер тестовой выборки 500 примеров 1000 примеров
Основной фокус качества Релевантность, леттеринг, общее предпочтение Сохранение черт референса, отсутствие дефектов, релевантность
Тип входных данных Текстовый промпт Исходное изображение + текстовая инструкция
Особенности данных Детальные описания сцены Локальные инструкции, замена персональных данных на открытые снимки

Значение для пользователей

Запуск Alice AI ART 2.0 означает переход к более стабильной и качественной работе с визуальным контентом в экосистеме Яндекса. Пользователи получат возможность генерировать изображения с высокой точностью следования текстовому описанию и редактировать существующие фото с сохранением ключевых деталей, всё это внутри единого интерфейса ассистента Алиса без необходимости переключаться между разными инструментами.

Источник: Habr ↗