google-research/text-to-text-transfer-transformer

Код для статьи "Исследование пределов трансферного обучения с унифицированным текстовым трансформером

LLM⭐ 6 553Pythonпоследний релиз: v0.4.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

T5 — это библиотека от Google для работы с унифицированной моделью Text-to-Text Transformer, которая преобразует любые задачи NLP в формат «текст-в-текст».

Зачем нужен

Инструмент позволяет предобучать, дообучать (fine-tune) и оценивать большие языковые модели на множестве задач. Он полезен для исследователей и разработчиков, которым нужна воспроизводимая база для экспериментов с transfer learning и мультизадачным обучением.

Что можно реализовать

  • Быстрое прототипирование NLP-задач (перевод, суммаризация, Q&A) через единую текстовую формулировку
  • Дообучение предобученных моделей T5 на собственных датасетах с использованием готовых препроцессоров
  • Воспроизведение экспериментов из оригинальной научной статьи Google
  • Мультизадачное обучение (multi-task training) путем смешивания различных текстовых задач

Ключевые возможности

  • Универсальный подход: любая задача NLP формулируется как задача перевода текста
  • Готовая инфраструктура для загрузки, препроцессинга и метрик (t5.data, t5.evaluation)
  • Поддержка обучения на TPUs (через MeshTF) и GPU (через Hugging Face Transformers)
  • Наличие предобученных чекпоинтов разных размеров для immediate use

👤 Кому подойдёт: Исследователи в области NLP, ML-инженеры, разработчики, работающие с предобученными моделями и нуждающиеся в гибком инструменте для fine-tuning и экспериментов.

Релизы

v0.4.0major
🕐 78 мес назад · релиз на GitHub ↗

Релиз T5 v0.4.0: добавлена поддержка TensorFlow 2.0, обучения и инференса на GPU, а также экспорт SavedModels.

  • Added: Добавлена поддержка TensorFlow 2.0.
  • Added: Реализовано обучение и инференс на GPU.
  • Added: Появилась возможность экспорта SavedModels для CPU и GPU.