togethercomputer/RedPajama-Data
Репозиторий RedPajama-Data содержит код для подготовки больших датасетов для обучения LLM.
Данные⭐ 4 985Python
Что это за инструмент
RedPajama-Data — это набор инструментов для подготовки огромных датасетов (до 30 триллионов токенов) из Common Crawl для обучения больших языковых моделей.
Зачем нужен
Инструмент решает задачу очистки, фильтрации и дедупликации сырых веб-данных. Он полезен для создания высококачественных обучающих выборок, так как автоматически вычисляет сигналы качества, удаляет дубликаты и фильтрует нежелательный контент.
Что можно реализовать
- Подготовка обучающих датасетов для обучения LLM на языке English, German, French, Italian, Spanish.
- Генерация минхэш-сигнатур для последующей нечеткой дедупликации текстовых документов.
- Фильтрация контента с использованием классификаторов качества и списков нежелательных слов (LDNOOBW, UT1 blacklist).
- Точная дедупликация данных по содержимому с использованием Bloomfilter.
Ключевые возможности
- Поддержка 5 языков: английский, немецкий, французский, итальянский, испанский.
- Полный пайплайн: от создания артефактов и вычисления сигналов качества до дедупликации.
- Использование DSIR weights для оценки важности документов.
- Готовая интеграция с S3 и поддержка запуска через Docker/Apptainer.
- Открытый доступ к датасету объемом 30.4T токенов (deduped) на HuggingFace.
👤 Кому подойдёт: ML-инженеры, исследователи в области NLP, разработчики, обучающие большие языковые модели.
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.