togethercomputer/RedPajama-Data

Репозиторий RedPajama-Data содержит код для подготовки больших датасетов для обучения LLM.

Данные⭐ 4 985Python
Открыть на GitHub ↗

Что это за инструмент

RedPajama-Data — это набор инструментов для подготовки огромных датасетов (до 30 триллионов токенов) из Common Crawl для обучения больших языковых моделей.

Зачем нужен

Инструмент решает задачу очистки, фильтрации и дедупликации сырых веб-данных. Он полезен для создания высококачественных обучающих выборок, так как автоматически вычисляет сигналы качества, удаляет дубликаты и фильтрует нежелательный контент.

Что можно реализовать

  • Подготовка обучающих датасетов для обучения LLM на языке English, German, French, Italian, Spanish.
  • Генерация минхэш-сигнатур для последующей нечеткой дедупликации текстовых документов.
  • Фильтрация контента с использованием классификаторов качества и списков нежелательных слов (LDNOOBW, UT1 blacklist).
  • Точная дедупликация данных по содержимому с использованием Bloomfilter.

Ключевые возможности

  • Поддержка 5 языков: английский, немецкий, французский, итальянский, испанский.
  • Полный пайплайн: от создания артефактов и вычисления сигналов качества до дедупликации.
  • Использование DSIR weights для оценки важности документов.
  • Готовая интеграция с S3 и поддержка запуска через Docker/Apptainer.
  • Открытый доступ к датасету объемом 30.4T токенов (deduped) на HuggingFace.

👤 Кому подойдёт: ML-инженеры, исследователи в области NLP, разработчики, обучающие большие языковые модели.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.