Новая архитектура: 2D RoPE против пиксельного кодирования
Ключевое нововведение заключается в использовании 2D RoPE (Rotary Positional Embeddings) для внедрения референсных латентов. В отличие от устаревших методов пиксельного кодирования, этот подход позволяет модели «запоминать» черты лица на уровне латентного пространства, что критически важно для сохранения микротекстур и анатомической корректности. Документация подчеркивает теоретическую базу метода, объясняя, почему традиционные LoRA-подходы часто теряют детали при масштабировании.
Масштаб данных и инструменты
Разработчик выложил в открытый доступ более 1,400 предварительно извлеченных RefMods на Hugging Face. Для работы с ними создан кастомный узел ComfyUI-Flux2Klein9Mod и скрипт generate_flux2_klein9_refmod.py, поддерживающий пакетную обработку, настройку бюджетов токенов и dry-run инспекцию. Это снижает порог входа для создания кастомных моделей сходства.
Эмпирические бенчмарки: Сравнение подходов
Проведены детальные сравнительные исследования на 6 наборах данных с известными личностями (Бретт Купер, Элисон Бри, Оливия Уайлд, Джоди Фостер, Ребекка Фергюсон, Сидни Суини). Результаты демонстрируют преимущества гибридных стеков. Ниже приведена структура сравнения методов генерации:
| Метод генерации | Описание | Преимущества | Недостатки |
|---|---|---|---|
| Pure LoRA | Только адаптеры низкого ранга | Низкое потребление VRAM | Потеря микротекстур, артефакты |
| 8-Raw Reference | Прямое использование референсов | Быстрая генерация | Низкая вариативность, шум |
| Pure RefMod | Только Reference Latent Adapters | Высокое сходство, чистый результат | Требует точной настройки токенов |
| Hybrid (RefMod + LoRA) | Комбинированный стек | Максимальное сходство + детализация | Высокая нагрузка на VRAM |
Готовые воркфлоу для ComfyUI
Для упрощения внедрения предоставлены два основных JSON-воркфлоу:
- workflow_klein9_refmod.json: Чистая генерация Text-to-Image с использованием только RefMods для FLUX.2/Klein 9B.
- workflow_klein9_refmod_lora.json: Гибридный «Power Stack», объединяющий RefMods и LoRA для достижения максимальной точности лица и текстуры кожи.
Разработчики также запустили интерактивный браузер моделей (Model Browser) для визуального поиска среди 1,400+ весов, что упрощает выбор оптимального референса для конкретных задач.
Источник: Huggingface ↗
