huggingface/transformers

🤗 Transformers: фреймворк для определения моделей для state-of-the-art машинного обучения в тексте, зрении, аудио и мультимодальных моделях, как для inference, так и для training.

Обучение⭐ 166 455Pythonпоследний релиз: v5.17.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Transformers — это фреймворк для определения моделей машинного обучения, обеспечивающий единый интерфейс для работы с текстом, изображением, аудио и мультимодальными моделями.

Зачем нужен

Инструмент решает задачу унификации определений моделей, позволяя использовать одни и те же архитектуры в различных фреймворках обучения (PyTorch, DeepSpeed, Axolotl) и инференса (vLLM, TGI, llama.cpp). Это упрощает внедрение state-of-the-art моделей как для инференса, так и для дообучения, обеспечивая совместимость в экосистеме.

Что можно реализовать

  • Быстрый запуск предобученных моделей для инференса (текст, vision, audio) через единый API
  • Дообучение (fine-tuning) современных моделей на собственных данных с использованием PyTorch или распределенных фреймворков
  • Интеграция моделей Hugging Face Hub в сторонние движки инференса, такие как vLLM или SGLang
  • Разработка мультимодальных приложений, объединяющих обработку текста, изображений и аудио

Ключевые возможности

  • Единое определение моделей, совместимое с большинством обучающих и инференс-фреймворков
  • Поддержка широкого спектра задач: NLP, компьютерное зрение, аудио и мультимодальные модели
  • Прямая интеграция с Hugging Face Hub для доступа к более чем 1 млн чекпоинтов
  • Поддержка как инференса, так и полного цикла обучения моделей
  • Активная экосистема и поддержка новых state-of-the-art архитектур

👤 Кому подойдёт: Разработчики ML, исследователи, инженеры по машинному обучению, работающие с предобученными моделями и нуждающиеся в стандартизированном интерфейсе для их использования и дообучения.

Релизы

v5.17.0major
🕐 11 дн назад · релиз на GitHub ↗

Выход HYV4 (780B MoE), VibeVoice для синтеза речи, NeoMME, Fun-ASR-Nano и KimiLinear.

  • Added: Добавлена поддержка HYV4 — 780B MoE-модели с контекстом 1M токенов и MLA.
  • Added: Реализован VibeVoice для синтеза длинной речи с несколькими говорящими.
  • Added: Добавлены мультиязычные энкодеры NeoMME и NeoMME-Retriever для работы с текстом и изображениями.
  • Added: Включена поддержка Fun-ASR-Nano — компактной модели распознавания речи от Alibaba.
  • Added: Добавлена архитектура KimiLinear с гибридным вниманием KDA от Moonshot AI.
v5.16.1minor
🕐 25 дн назад · релиз на GitHub ↗

Релиз v5.16.1 добавляет поддержку мультимодальной модели GLM-5.3-Flash и исправляет проблемы с тензорным параллелизмом.

  • Added: Добавлена поддержка GLM-5.3-Flash — первой нативно мультимодальной модели серии GLM-5 с гибридной архитектурой.
  • Fixed: Восстановлена обратная совместимость для API тензорного параллелизма (tensor-parallel).
  • Fixed: Исправлены пути к репозиторию и коммитам для ядра ESMFold2.
v5.15.1patch
🕐 1 мес назад · релиз на GitHub ↗

Исправлены ошибки в DFlash, MTP и обработке изображений с фильтром Lanczos на GPU.

  • Fixed: Исправлено несоответствие устройств токенов-кандидатов в DFlash при использовании device_map="auto".
  • Fixed: Выровнены распределения логитов для CandidateGenerators, использующих сэмплирование.
  • Fixed: Исправлена конфигурация MTP при отсутствии параметра mlp_layer_types.
  • Fixed: На CUDA добавлен fallback с фильтра Lanczos на bicubic для корректной обработки изображений.
  • Fixed: Исправлена пересылка видео Gemma4 на устройство.
v5.15.0majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

Добавлена поддержка новых моделей (Meta Muse Glimmer, Granite, A.X-K1/K2, Cosmos3 Edge), улучшена работа внимания и внесены ломающие изменения в API.

  • Added: Добавлена поддержка моделей Meta Muse Glimmer, GraniteSWA, GraniteMoeSWA, A.X-K1, A.X-K2 и Cosmos3 Edge.
  • Breaking: Кernels для линейного внимания теперь требуют явного включения, а не выбираются автоматически.
  • Breaking: API обрезки кэша теперь принимает только отрицательные значения (относительные смещения).
  • Breaking: T5 и его семейство теперь поддерживают SDPA по умолчанию; для возврата к старому поведению нужно явно указать attn_implementation='eager'.
  • Fixed: Исправлены ошибки в MLA, оптимизирован Flash Attention для vision-моделей и улучшена поддержка MPS.
v5.14.1patch
🕐 2 мес назад · релиз на GitHub ↗

Исправлены критические ошибки в SDPA, ассистированной генерации и DeepGEMM, связанные с интеграцией модели Inkling.

  • Fixed: Исправлена работа SDPA при префиллинге с position_bias без паддинга.
  • Fixed: Устранена ошибка ассистированного декодирования для моделей с EncoderDecoderCache и OlmoHybrid.
  • Fixed: Исправлена работа deepgemm на нескольких устройствах.
  • Added: Обновлена версия ядер для FP8.
v5.13.0minor
🕐 2 мес назад · релиз на GitHub ↗

Добавлена поддержка моделей Kimi K2.5/2.6/2.7, MiMo-V2-Flash, Nemotron 3.5 ASR и Qwen3 ASR.

  • Added: Добавлена архитектура и поддержка мультимодальных агентных моделей Kimi K2.5, K2.6 и K2.7.
  • Added: Включена поддержка MoE-модели MiMo-V2-Flash с контекстным окном до 256K токенов.
  • Added: Добавлена поддержка моделей распознавания речи Nemotron 3.5 ASR и Nemotron ASR Streaming.
  • Added: Добавлена поддержка модели автоматического распознавания речи Qwen3 ASR.
v5.12.1patch
🕐 3 мес назад · релиз на GitHub ↗

Патч v5.12.1: исправлена работа AutoTokenizer для Mistral и обновлён минимальный порог версии PEFT.

  • Fixed: Исправлена корректная работа AutoTokenizer для токенизатора Mistral при наличии пакета mistral-common.
  • Fixed: Обновлён нижний порог зависимости для библиотеки PEFT.