От разрозненных стеков к единому фундаменту
Предыдущее поколение Alice AI ART 1.0 опиралось на классический диффузионный свёрточный генератор для создания изображений (T2I) и отдельный пайплайн для редактирования (I2I). Такая архитектура создавала значительные операционные издержки: улучшения приходилось внедрять дважды, данные готовились раздельно, а метрики качества было сложно сравнивать. Команда Яндекса провела полгода экспериментов, чтобы создать единую модель (unified), которая одинаково эффективно решает обе задачи, перенимая визуальные и текстовые приоритеты друг у друга.
Методология оценки: «Корзины» и «Слайсы»
Яндекс отказался от стандартных академических бенчмарков, которые легко «взломать» и которые плохо коррелируют с реальным пользовательским опытом. Вместо этого разработчики сформировали специализированные наборы данных на основе реальных запросов из Алисы и Шедеврума. Оценка качества строится на трёх уровнях выборки:
- Validation: рабочая корзина для ежедневных экспериментов.
- Test: hold-out выборка для проверки на переобучение (используется раз в несколько недель).
- Deploy: финальная оценка предрелизных моделей.
Важно отметить, что для задач редактирования (I2I) используется выборка в 1000 примеров (против 500 для T2I), так как сценарии редактирования требуют более широкого покрытия. Для критически важных категорий, таких как работа с текстом на изображении (леттеринг) и стилизация, выделены отдельные «слайсы» с оверсэмплингом.
Техническая синергия задач
Объединение задач позволило модели извлекать выгоду из обеих дисциплин. Задача I2I (Image-to-Image) заставляет модель точно кодировать визуальное содержимое референса — форму, текстуру и пространственные отношения. Навык «чтения картинки» напрямую улучшает общее визуальное восприятие. В свою очередь, данные T2I (Text-to-Image) содержат более богатые и детальные описания (освещение, стиль, композиция), что углубляет понимание языка и релевантности запроса.
Ключевые метрики и фокус качества
Система метрик разделена по типам задач. Для T2I главным сигналом является предпочтительность результата пользователем и точность следования запросу, с особым вниманием к качеству отрисовки текста. Для I2I критически важно не только качество изменений, но и сохранение исходных черт изображения при низкой дефектности изменённых регионов. Общий результат в I2I считается плохим, если хотя бы один из критериев (релевантность, сохранение, дефектность) не проходит порог.
| Параметр | Text-to-Image (T2I) | Image-to-Image (I2I) |
|---|---|---|
| Размер тестовой выборки | 500 примеров | 1000 примеров |
| Основной фокус качества | Релевантность, леттеринг, общее предпочтение | Сохранение черт референса, отсутствие дефектов, релевантность |
| Тип входных данных | Текстовый промпт | Исходное изображение + текстовая инструкция |
| Особенности данных | Детальные описания сцены | Локальные инструкции, замена персональных данных на открытые снимки |
Значение для пользователей
Запуск Alice AI ART 2.0 означает переход к более стабильной и качественной работе с визуальным контентом в экосистеме Яндекса. Пользователи получат возможность генерировать изображения с высокой точностью следования текстовому описанию и редактировать существующие фото с сохранением ключевых деталей, всё это внутри единого интерфейса ассистента Алиса без необходимости переключаться между разными инструментами.
Источник: Habr ↗
