bghira/SimpleTuner

Универсальный набор для тонкой настройки моделей диффузии, работающих с изображениями, видео и аудио.

Обучение⭐ 2 925Pythonпоследний релиз: v4.9.2
Открыть на GitHub ↗

Что это за инструмент

SimpleTuner — это набор инструментов для тонкой настройки (fine-tuning) диффузионных моделей, поддерживающий генерацию изображений, видео и аудио.

Зачем нужен

Инструмент упрощает процесс обучения моделей, предлагая интуитивный веб-интерфейс и оптимизацию для работы с разным объемом данных. Он позволяет эффективно использовать GPU, включая обучение на картах с 16-24 ГБ памяти, за счет таких техник, как кэширование эмбеддингов и интеграция с DeepSpeed/FSDP2.

Что можно реализовать

  • Тонкая настройка моделей Stable Diffusion или аналогичных диффузионных архитектур под конкретный стиль или набор данных.
  • Обучение генеративных моделей для видео и аудио в едином конвейере.
  • Организация многопользовательской среды для команд исследователей с контролем квот, ролей и очередей задач.
  • Обучение на облачных хранилищах (S3, Cloudflare R2) без предварительной загрузки данных на локальные диски.

Ключевые возможности

  • Поддержка мульти-модального обучения: изображения, видео и аудио.
  • Встроенный веб-интерфейс (Web UI) для управления полным циклом обучения.
  • Продвинутая оптимизация памяти: поддержка DeepSpeed, FSDP2 и кэширование на диск.
  • Готовая система для энтерпрайз-использования: SSO, RBAC, квоты и оркестрация распределенных GPU-воркеров.
  • Aspect bucketing и Concept sliders для точной настройки параметров генерации.

👤 Кому подойдёт: разработчики, исследователи в области AI, команды, занимающиеся разработкой и тонкой настройкой генеративных моделей

Релизы

v4.9.2patch
🕐 14 дн назад · релиз на GitHub ↗

Исправления багов валидации, метрик и путей, поддержка Mixed ConvRot для MiniMax H3, оптимизация работы с диском и вниманием.

  • Fixed: Исправлена работа масок кондиционирования в вложенных директориях датасетов и навигации по чекпоинтам в отчетах.
  • Fixed: Устранены ошибки в путях конфигурации WebUI, типах ключей бакетов при обновлении кэша и отображении метрик.
  • Added: Добавлена поддержка смешанных групп ConvRot для чекпоинтов MiniMax H3 и учёт выбора бэкенда внимания в SDPA.
  • Fixed: Учтена политика низкого места на диске перед компиляцией TorchInductor и обновлены пути в карточках моделей Hugging Face.
  • Added: Добавлена возможность продолжения упавших локальных задач, показ имен проектов и запуск хуков после валидации.
v4.9.1minor
🕐 20 дн назад · релиз на GitHub ↗

Релиз SimpleTuner v4.9.1: поддержка Krea2 Turbo LoRA, оптимизация фильтрации данных, улучшенные метрики и множество исправлений.

  • Added: Добавлена поддержка LoRA Krea2 Turbo от TheDivergentAI и исправлены параметры динамического сдвига.
  • Added: Внедрена оптимизированная фильтрация данных для всех бэкендов и расширено метаданное bucketing для статических изображений.
  • Added: Добавлены локальные галереи метрик, графики таймстепов и ручное логирование системных показателей.
  • Fixed: Исправлена инициализация трекера W&B, восстановление состояния валидационных адаптеров и форматы артефактов.
  • Fixed: Устранены ошибки в логировании аудита, обработке CUDA OOM и сборке QuantoLoraConv2d.
v4.9.0majorbreaking
🕐 22 дн назад · релиз на GitHub ↗

Релиз v4.9.0: добавлены NextLat и Explorative Modeling, улучшена компиляция LTX 2.5, внедрён RVC-тренажер и оптимизация VRAM.

  • Breaking: Удалена интеграция group offload из Diffusers; бэкенд Torch Inductor переписан на C++.
  • Added: Добавлены методы NextLat и Explorative Modeling (XM) для улучшения качества и стабильности генерации.
  • Added: Встроенный тренажер RVC для расширения датасетов музыки и поддержка Mega-Cache для загрузки/экспорта через Hugging Face Hub.
  • Added: Оптимизация RamTorch для совместного использования квантованных весов между процессами GPU, снижающая потребление VRAM.
  • Fixed: Исправлены графовые разрывы при компиляции LTX 2.5 с Flash Attention 2, работа SDNQ и режим reduce-overhead с активационной чекпоинтингом.
v4.8.0major
🕐 1 мес назад · релиз на GitHub ↗

SimpleTuner v4.8.0: поддержка InfiniteTalk, MixFlow, Self-Transcendence, локальный мониторинг и исправления багов.

  • Added: Добавлена поддержка обучения InfiniteTalk с оптимизированными конфигурациями по VRAM.
  • Added: Внедрены новые методы: Self-Transcendence, Internal Guidance, MixFlow и DiffusionBlocks.
  • Added: Добавлен встроенный локальный дашборд метрик (Prometheus/WebUI) как замена TensorBoard.
  • Added: Реализована поддержка кубического сплайна для распределения временных шагов flow-matching.
  • Fixed: Исправлены баги кэширования мульти-подписей, Audio VAE при батчах >1 и детерминизм DDP.
v4.7.1major
🕐 1 мес назад · релиз на GitHub ↗

Поддержка LTX Video 2.5, MiniMax Music 3 и H3, новые опции для LoRA и батчей, улучшения AnyFlow и Webshart.

  • Added: Полная поддержка дообучения LTX Video 2.5
  • Added: Расширенная работа с MiniMax Music 3: дистилляция RVQ, латентные рефинеры и обучение LoRA
  • Added: Новые флаги --init_lora_step и train_batch_size для управления шагами LoRA и размера батчей
  • Added: Поддержка аудио-тренинга для MiniMax H3 и оптимизация датасетов Webshart с .txt подписями
  • Fixed: Исправления в AnyFlow (воспроизводимость, негативные промпты), MiniMax H3 и Metal FlashAttention
v4.7.0major
🕐 1 мес назад · релиз на GitHub ↗

Поддержка MiniMax H3, Webshart видео, EMA и LoRA; исправления Flux2, AnyFlow, LTX и баги мульти-GPU.

  • Added: Добавлена поддержка моделей MiniMax H3 (v2v, i2v, t2v) и fl2v, включая дистилляцию h3_drift.
  • Added: Webshart datasets теперь поддерживают видео, протестировано на OpenVid 1M и MiniMax H3.
  • Added: Реализован режим EMA copy-through для синхронизации EMA с активными весами до начала обучения.
  • Added: Улучшена поддержка формата LoRA comfyui и добавлена поддержка MultiGPU FP8 RamTorch.
  • Fixed: Исправлена ошибка смешанной точности в Flux2 attention для строгих механизмов внимания.
  • Fixed: Исправлена двойная квантование SDNQ моделей и корректная работа mixed-rank LoRA с init_lora.
v4.6.1patch
🕐 1 мес назад · релиз на GitHub ↗

Исправлены ошибки при обработке данных и отключении кэша VAE в SimpleTuner v4.6.1.

  • Fixed: Исправлена ошибка отклонения ранга, оставшегося без сэмплов после перераспределения эпохи.
  • Fixed: Устранена ошибка KeyError при отключении кэширования VAE.
v4.6.0major
🕐 1 мес назад · релиз на GitHub ↗

Релиз SimpleTuner v4.6.0: оптимизация скорости через сегментированное чекпоинтирование и выгрузку активаций, поддержка новых видео-моделей.

  • Added: Введено сегментированное чекпоинтирование для снижения задержек и улучшения кэширования при сохранении высокой скорости обучения.
  • Added: Добавлена выгрузка активаций внимания (attention activation offload) на CPU, что позволяет экономить VRAM без полного отключения gradient checkpointing.
  • Added: Добавлены примеры конфигураций и поддержка новых моделей: Wan S2V, SanaVideo, LTXVideo 0.9.5, LongCat Video, Anima, Kolors и других.
  • Added: Расширена поддержка сегментированного чекпоинтирования для архитектур ACE-Step, AuraFlow, Boogu, Chroma, Cosmos, Cosmos 3 и ERNIE.
  • Fixed: Исправлена совместимость пайплайнов LongCat и Kandinsky5, а также нормализованы базовые URL API.
v4.3.5minor
🕐 3 мес назад · релиз на GitHub ↗

Добавлена поддержка Boogu Image v0.1, Ideogram4 и Qwen Image, включено SDNQ, исправлен экспорт и WebUI.

  • Added: Добавлена поддержка модели Boogu Image v0.1 с оптимизацией для H100 и torch compile.
  • Added: Включена валидация обучения Ideogram4 на Apple Silicon и активированы уровни квантования SDNQ.
  • Added: Улучшена поддержка Qwen Image за счёт отказа от сложных тензоров для лучшей работы torch compile.
  • Added: Добавлена реализация Prompt2Effect для обучения гиперсети на основе effect LoRA.
  • Fixed: Исправлен краш при экспорте в один файл для SD/SDXL с transformers >=5.6.
  • Fixed: Устранена ошибка двойного сдвига в планировщике Euler flow matching и сбой запуска WebUI.