Архитектура и ключевые улучшения
Команда OpenSenseNova представила SenseNova-U1.5-8B-MoT, обновленную версию своей мультимодальной модели. В основе лежит архитектура NEO-unify, которая была доработана на уровне слоев патчинга, качества данных и пайплайна пост-обучения (SFT, RL, MOPD). Главная цель обновления — устранение разрыва между пониманием текста и визуальным созданием контента.
Модель позиционируется как «нативно унифицированная», что означает отсутствие жесткого разделения на модули распознавания и генерации. Это позволяет ей лучше сохранять контекст при редактировании изображений и генерации сложных макетов.
Производительность: Скорость против Качества
Одним из главных нововведений стала оптимизация скорости инференса. Выпущена версия SenseNova-U1.5-8B-MoT-LoRA-8step, которая генерирует изображение за 8 шагов. По заявлениям разработчиков, качество при таком подходе сопоставимо с базовой моделью, использующей больше шагов, что критически важно для реального времени.
| Характеристика | SenseNova-U1.5-8B-MoT (Base) | SenseNova-U1.5-8B-MoT-LoRA-8step |
|---|---|---|
| Количество шагов генерации | Стандартное (высокое) | 8 шагов |
| Качество изображения | Высокое (эталон) | Близкое к базовому (в большинстве сценариев) |
| Параметр CFG Scale | Обычный | 1.0 (рекомендуется для 8-шаговой версии) |
| Размер весов | Полные веса | LoRA-адаптер (легковесный) |
Визуальные возможности: 4K и Текст
Модель поддерживает нативную генерацию в разрешении 4K без потери целостности структуры. Это решает проблему «размытия» деталей при масштабировании, характерную для многих предыдущих моделей. Особое внимание уделено рендерингу текста:
- Улучшена читаемость китайских и английских символов.
- Повышена точность генерации инфографики и плотных макетов (постеры, брендинг).
- Исправлены артефакты с черным фоном, присутствовавшие в предыдущих версиях.
Редактирование и Контроль
SenseNova-U1.5 демонстрирует высокую надежность при локальном редактировании. Модель умеет сохранять идентичность объекта и неизменность фона при замене элементов, вставке новых объектов или изменении стиля. Также улучшен визуальный контроль через bounding boxes и референсные изображения.
Деплой и Доступность
Модель доступна на Hugging Face и GitHub. Для ускорения работы энтузиастами уже подготовлены квантованные веса формата Q8 GGUF (размер ~19.9 ГБ), что позволяет запускать модель на потребительских видеокартах с меньшим объемом VRAM. Также опубликован код для обучения полными параметрами (full-parameter fine-tuning).
Пример запуска через Transformers:
python examples/t2i/inference.py \
--model_path sensenova/SenseNova-U1.5-8B-MoT \
--prompt "A formal portrait depicts a man in 18th-century attire..." \
--output output.png
Ограничения текущей версии
Несмотря на прогресс, разработчики отмечают проблемы с:
- Чрезмерной насыщенностью цветов или деталей (решается снижением
cfg_scale). - Ошибками в плотном тексте (особенно смешанном китайско-английском).
- Нестабильностью мелких деталей рук и лиц в сложных композициях.
Источник: Github ↗
