microsoft/unilm

Масштабное самообучаемое предобучение для различных задач, языков и модальностей

Мультимодальные⭐ 22 221Pythonпоследний релиз: yoco.v0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Microsoft unilm — это набор библиотек и предобученных моделей для масштабного самообучения (self-supervised pre-training) в области NLP, компьютерного зрения, обработки речи и мультимодальных задач.

Зачем нужен

Инструмент предоставляет готовые архитектуры (например, Transformer, MoE) и модели для решения широкого спектра задач: от понимания текста и перевода до анализа документов и генерации речи. Он полезен для создания универсальных интерфейсов и эффективного внедрения AI-решений в различные домены без необходимости обучения моделей с нуля.

Что можно реализовать

  • Мультимодальное понимание документов (OCR, анализ PDF, извлечение данных из отсканированных форм) с помощью LayoutLM и MarkupLM.
  • Создание систем поиска и семантического сопоставления текста с использованием эмбеддингов E5 и моделей SimLM.
  • Генерация речи (TTS) и распознавание речи (ASR) через модели VALL-E, WavLM и SpeechT5.
  • Адаптация больших языковых моделей (LLM) под конкретные домены или задачи с помощью методов дистилляции (MiniLLM) и адаптации (AdaLM).
  • Обработка изображений и документов с помощью генеративных моделей BEiT и TextDiffuser.

Ключевые возможности

  • Поддержка 100+ языков и кросс-лингвальных задач (InfoXLM, DeltaLM/mT6).
  • Мультимодальность: объединение текста, изображений, аудио и разметки в единых моделях (Kosmos, LayoutLM, UniSpeech).
  • Высокая эффективность и масштабируемость: архитектуры DeepNet (1000+ слоев), LongNet (миллиарды токенов) и X-MoE (sparse MoE).
  • Низкоразрядные модели: BitNet (1-bit Transformers) для оптимизации вычислений.
  • Готовые решения для edge-устройств (EdgeLM) и генерации текста/изображений (TextDiffuser).

👤 Кому подойдёт: Исследователи в области AI, ML-инженеры, разработчики NLP и Computer Vision, специалисты по Document AI.

Релизы

yoco.v0major
🕐 28 мес назад · релиз на GitHub ↗

Выпущена модель YOCO v0, основанная на архитектуре MoE и оптимизированная для эффективного обучения с использованием FlashAttention.

  • Added: Представлена новая модель YOCO v0, использующая архитектуру MoE.
  • Added: Внедрена оптимизация обучения с применением FlashAttention.
  • Added: Опубликована техническая документация и детали архитектуры модели.