stas00/ml-engineering

Открытая книга по машинному обучению

Инструменты⭐ 19 025Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Это открытый технический справочник (Open Book) по ML-инжинирингу, основанный на личном опыте автора по обучению больших языковых моделей (LLM) и мультимодальных моделей (VLM).

Зачем нужен

Инструмент помогает инженерам и операторам успешно проводить обучение, тонкую настройку (fine-tuning) и инференс больших моделей. Он предоставляет готовые скрипты, пошаговые инструкции и решения для отладки, позволяя быстро запускать задачи без длительного поиска информации.

Что можно реализовать

  • Выбор облачного провайдера и оценка характеристик вычислительных ресурсов (accelerators, CPU, memory)
  • Настройка и управление кластерами с помощью оркестраторов, таких как SLURM и контейнеры
  • Отладка сложных проблем в PyTorch-приложениях (например, зависания или ошибки распределенного обучения)
  • Бенчмаркинг производительности сети (intra- и inter-node) и ускорителей (TFLOPS)
  • Изучение методологий оптимизации хранения данных и файловой системы для распределенных вычислений

Ключевые возможности

  • Готовые скрипты и команды copy-n-paste для быстрого решения инженерных задач
  • Практический опыт на примере реальных проектов: BLOOM-176B, IDEFICS-80B и RAG-моделей
  • Детальные руководства по hardware (compute, storage, network) и orchestration
  • Наличие версий в форматах PDF и EPUB для удобного чтения офлайн
  • Интеграция с AI-агентами через файл SKILL.md для обучения агентов лучшим практикам ML-инжиниринга

👤 Кому подойдёт: Инженеры по машинному обучению (LLM/VLM training engineers), операторы ML-инфраструктуры и разработчики, работающие с крупными моделями и распределенными вычислениями.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.