FasterDecoding/Medusa

Medusa: простая фреймворк для ускорения генерации LLM с несколькими головами декодирования

Инференс⭐ 2 773Jupyter Notebookпоследний релиз: v0.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Medusa — это фреймворк для ускорения генерации текстов в больших языковых моделях (LLM) за счёт добавления нескольких дополнительных заголовков декодирования (decoding heads).

Зачем нужен

Инструмент решает проблемы традиционного speculative decoding, устраняя необходимость в отдельной черновой модели и снижая системную сложность. Он позволяет ускорить генерацию (в 2-3.6 раза) за счёт параллельного предсказания нескольких будущих токенов, что особенно эффективно при использовании методов выборки (sampling).

Что можно реализовать

  • Локальный хостинг LLM с оптимизацией под batch size 1 для увеличения скорости ответа
  • Добавление ускорения к уже существующим fine-tuned моделям без доступа к исходным данным обучения (через self-distillation)
  • Полноценное обучение модели (Medusa-2) для сохранения качества оригинала при значительном ускорении
  • Запуск инференса на ресурсах с ограниченным количеством GPU благодаря параметрически эффективному обучению

Ключевые возможности

  • Отсутствие необходимости в отдельной draft-модели: новые заголовки дообучаются на той же архитектуре
  • Поддержка self-distillation для применения к любым fine-tuned LLM без переобучения с нуля
  • Параметрически эффективное обучение (parameter-efficient), не требующее сложной настройки распределённых вычислений
  • Ускорение non-greedy генерации (sampling) быстрее, чем greedy decoding оригинальной модели
  • Готовые веса для популярных моделей (Vicuna, Zephyr) и поддержка full-model training (Medusa-2)

👤 Кому подойдёт: Исследователи и разработчики, работающие с LLM, которым нужно ускорить инференс без усложнения инфраструктуры или потери качества генерации.

Релизы

v0.1major
🕐 36 мес назад · релиз на GitHub ↗

Medusa v0.1: фреймворк для ускорения генерации LLM через легкие декодирующие головы без необходимости в draft-модели.

  • Added: Демократизация методов ускорения генерации больших языковых моделей.
  • Added: Использование нескольких легких декодирующих голов (decoding heads).
  • Added: Отказ от необходимости использования draft-модели.