Релиз модели21 августа 2026 г., 23:45 МСК🤖 Auto

SenseNova-U1.5-8B: Нативное 4K, 8-шаговая генерация и новый стандарт MLLM

OpenSenseNova выпустила SenseNova-U1.5-8B-MoT — модель с архитектурой NEO-unify, способную генерировать изображения в нативном 4K за 8 шагов и точно следовать сложным инструкциям.

Баннер новости 6271

Архитектура и ключевые улучшения

Команда OpenSenseNova представила SenseNova-U1.5-8B-MoT, обновленную версию своей мультимодальной модели. В основе лежит архитектура NEO-unify, которая была доработана на уровне слоев патчинга, качества данных и пайплайна пост-обучения (SFT, RL, MOPD). Главная цель обновления — устранение разрыва между пониманием текста и визуальным созданием контента.

Модель позиционируется как «нативно унифицированная», что означает отсутствие жесткого разделения на модули распознавания и генерации. Это позволяет ей лучше сохранять контекст при редактировании изображений и генерации сложных макетов.

Производительность: Скорость против Качества

Одним из главных нововведений стала оптимизация скорости инференса. Выпущена версия SenseNova-U1.5-8B-MoT-LoRA-8step, которая генерирует изображение за 8 шагов. По заявлениям разработчиков, качество при таком подходе сопоставимо с базовой моделью, использующей больше шагов, что критически важно для реального времени.

Характеристика SenseNova-U1.5-8B-MoT (Base) SenseNova-U1.5-8B-MoT-LoRA-8step
Количество шагов генерации Стандартное (высокое) 8 шагов
Качество изображения Высокое (эталон) Близкое к базовому (в большинстве сценариев)
Параметр CFG Scale Обычный 1.0 (рекомендуется для 8-шаговой версии)
Размер весов Полные веса LoRA-адаптер (легковесный)

Визуальные возможности: 4K и Текст

Модель поддерживает нативную генерацию в разрешении 4K без потери целостности структуры. Это решает проблему «размытия» деталей при масштабировании, характерную для многих предыдущих моделей. Особое внимание уделено рендерингу текста:

  • Улучшена читаемость китайских и английских символов.
  • Повышена точность генерации инфографики и плотных макетов (постеры, брендинг).
  • Исправлены артефакты с черным фоном, присутствовавшие в предыдущих версиях.

Редактирование и Контроль

SenseNova-U1.5 демонстрирует высокую надежность при локальном редактировании. Модель умеет сохранять идентичность объекта и неизменность фона при замене элементов, вставке новых объектов или изменении стиля. Также улучшен визуальный контроль через bounding boxes и референсные изображения.

Деплой и Доступность

Модель доступна на Hugging Face и GitHub. Для ускорения работы энтузиастами уже подготовлены квантованные веса формата Q8 GGUF (размер ~19.9 ГБ), что позволяет запускать модель на потребительских видеокартах с меньшим объемом VRAM. Также опубликован код для обучения полными параметрами (full-parameter fine-tuning).

Пример запуска через Transformers:

python examples/t2i/inference.py \
  --model_path sensenova/SenseNova-U1.5-8B-MoT \
  --prompt "A formal portrait depicts a man in 18th-century attire..." \
  --output output.png

Ограничения текущей версии

Несмотря на прогресс, разработчики отмечают проблемы с:

  • Чрезмерной насыщенностью цветов или деталей (решается снижением cfg_scale).
  • Ошибками в плотном тексте (особенно смешанном китайско-английском).
  • Нестабильностью мелких деталей рук и лиц в сложных композициях.

Источник: Github ↗