mlfoundations/open_lm

Репозиторий для исследований в области языковых моделей среднего размера.

Обучение⭐ 536Python
Открыть на GitHub ↗

Что это за инструмент

OpenLM — это минималистичный и производительный репозиторий на базе PyTorch для обучения языковых моделей среднего размера (до 7B параметров). В отличие от тяжелых фреймворков, он использует только PyTorch, XFormers и Triton, что упрощает настройку и исследование архитектуры.

Зачем нужен

Инструмент предназначен для исследователей и разработчиков, которым нужен гибкий стек для экспериментов с LLM без избыточной сложности. Он позволяет быстро запускать обучение, используя распределенные вычисления через torchrun и FSDP, а также интегрировать логирование в Weights & Biases или TensorBoard.

Что можно реализовать

  • Исследование архитектуры и гиперпараметров для моделей от 11M до 7B параметров
  • Обучение моделей на больших датасетах с использованием WebDataset и загрузки в S3
  • Быстрый прототипинг новых подходов к обучению LLM с минимальным количеством зависимостей
  • Сравнительный анализ производительности на кластерах из сотен GPU (верифицировано до 256 GPU)

Ключевые возможности

  • Минимальные зависимости: только PyTorch, XFormers, Triton
  • Поддержка моделей до 7B параметров с верифицированной работой на 256 GPU
  • Встроенная обработка данных через WebDataset и скрипты токенизации (BPE)
  • Гибкое управление обучением: выбор между сэмплированием с заменой и без, поддержка FSDP и amp_bfloat16
  • Интеграция с Weights & Biases и TensorBoard для мониторинга метрик

👤 Кому подойдёт: Исследователи в области NLP, ML-инженеры, разработчики, создающие кастомные решения для обучения LLM

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.