mlfoundations/open_lm
Репозиторий для исследований в области языковых моделей среднего размера.
Что это за инструмент
OpenLM — это минималистичный и производительный репозиторий на базе PyTorch для обучения языковых моделей среднего размера (до 7B параметров). В отличие от тяжелых фреймворков, он использует только PyTorch, XFormers и Triton, что упрощает настройку и исследование архитектуры.
Зачем нужен
Инструмент предназначен для исследователей и разработчиков, которым нужен гибкий стек для экспериментов с LLM без избыточной сложности. Он позволяет быстро запускать обучение, используя распределенные вычисления через torchrun и FSDP, а также интегрировать логирование в Weights & Biases или TensorBoard.
Что можно реализовать
- Исследование архитектуры и гиперпараметров для моделей от 11M до 7B параметров
- Обучение моделей на больших датасетах с использованием WebDataset и загрузки в S3
- Быстрый прототипинг новых подходов к обучению LLM с минимальным количеством зависимостей
- Сравнительный анализ производительности на кластерах из сотен GPU (верифицировано до 256 GPU)
Ключевые возможности
- Минимальные зависимости: только PyTorch, XFormers, Triton
- Поддержка моделей до 7B параметров с верифицированной работой на 256 GPU
- Встроенная обработка данных через WebDataset и скрипты токенизации (BPE)
- Гибкое управление обучением: выбор между сэмплированием с заменой и без, поддержка FSDP и amp_bfloat16
- Интеграция с Weights & Biases и TensorBoard для мониторинга метрик
👤 Кому подойдёт: Исследователи в области NLP, ML-инженеры, разработчики, создающие кастомные решения для обучения LLM